[230206] 모두의연구소가 전해드리는 오늘의 AI뉴스
안녕하세요 모두의연구소 다육이입니다.
오늘 AI뉴스는 HuggingFace에서 나온 멀티모달 모델 소개와 이미지 캡셔닝 스페이스를 소개할 예정입니다.
또한 Google Research에서 인공지능으로 산불 트래커를 만들고 정부에 어떻게 기여하는지에 대한 소개와
TensorFlow Coral팀에서 만든 임베디드 AI 기기인 Coral Dev Board Micro를 소개할 예정입니다.
https://huggingface.co/blog/vision_language_pretraining
허깅페이스에서 vision과 Language model을 결합한 멀티모달 모델들을 소개하는 글이 올라왔습니다. OpenAI의 CLIP과 같은 멀티모달 모델은 이미지 캡셔닝, 텍스트 이미지 생성 및 조작, 비주얼 Q&A와 같은 task에서 좋은 결과를 보여줬습니다. 이번 블로그는 멀티모달에 대해서 개괄적으로 설명하고 이를 구현하기 위해서 HuggingFace Transformers를 사용합니다. 이번 블로그도 Paul Sayak님께서 작성하셨습니다. 멀티모달 모델이 궁금하다면 클릭해주세요~~!!
https://ai.googleblog.com/2023/02/real-time-tracking-of-wildfire.html
구글 리서치에서 산불 트래커에 대해 소개했습니다. 구글에서 사회적 기여를 위해 산불을 머신러닝과 위성 영상을 이용해 추적하고 영향을 받는 시스템을 구축했습니다. 현재 구글은 미국뿐만 아니라 멕시코, 캐나다, 호주와 같은 나라에서도 대형 산불을 추적할 수 있으며 정부에서 제공하는 추가정보로 Google 검색과 Google 지도에 표시를 시켰다고 합니다. 이런 내용이 궁금하시다면 클릭해주세요.
https://blog.tensorflow.org/2023/02/tensorflow-lite-micro-with-ml-acceleration.html
모바일과 임베디드 시스템에서 딥러닝을 사용하기 위해서는 TFLite와 TFLM이 있습니다. TFLite는 복잡한 모델도 실행할 수 있지만 모바일이나 라즈베리 파이와 같은 강력한 프로세서와 고수준의 OS가 필요합니다. TFLM의 경우 낮은 전력 프로세서에서 사용할 수 있지만 성능을 보장할 수 없습니다. 구글에서 만든 Coral Dev Board Micro의 경우 TFLite의 장점과 TFLM의 낮은 전성비를 결합해 가장 좋은 결과를 제공해준다고 합니다. 실제 크기도 그렇고 inference 속도에서도 좋은 퍼포먼스를 냅니다. 임베디드 AI에 관심있다면 링크를 눌러주세요
허깅페이스에서 이미지 캡셔닝(Image Captioning) 모델을 비교할 수 있는 데모사이트를 가지고 왔어요.
5 가지 모델(COCO, GIT, BLIP, ViT+GPT2, CoCa)을 비교할 수 있는데 한 눈에 비교할 수 있는 게 참 좋더라구요. 예시 이미지도 있고, 가지고 있는 이미지도 업로드해서 볼 수 있습니다.
캡셔닝 관심있으신 분들은 확인해보세요~!
⎯⎯⎯모두의연구소는 함께 공유하고 성장하는 연구 문화를 전파합니다
linktr.ee/modulabs