[230308] AI 개발자라면 알아야 하는 데일리 뉴스
안녕하세요
국내 최대 오프라인 AI 커뮤니티 모두의연구소입니다.
현재 AI 학교 아이펠도 운영하고 있어요.
여러분들의 AI개발에 도움이 되도록 최신 소식을 쉽고 빠르게 알려드리고 있어요.
지난 AI뉴스 모두보기 ⇒ https://page.stibee.com/archives/181723
카카오브레인이 7억개 쌍이 있는 이미지-텍스트 오픈소스 데이터셋 COYO와 이를 기반으로 하는 ViT와 ALIGN 모델을 공개했습니다. ViT와 ALIGN 모두 2021년에 구글에서 발표한 모델이지만 데이터셋의 크기는 공개되었지만 구체적인 데이터셋이 공개되지 않았습니다. 이번 카카오브레인에서 만든 ViT와 ALIGN 모델은 COYO 데이터셋을 기반으로 하기 때문에 재현가능한 장점이 있습니다. 또한 ViT는 오픈소스화되었지만 ALIGN모델을 오프소스화 시킨 곳은 카카오브레인이 유일합니다!! 해당 url에는 사용방법까지 자세하게 나와있어 관심 있는 분은 클릭해주세요!!
구글 리서치에서 1000개의 언어를 지원하는 Universal Speech Model(USM)을 발표했습니다. USM은 300개 이상의 언어가 포함되어 있으며 총 1200만 시간의 음성과 280억개의 텍스트로 학습되었으며 파라미터의 총합은 약 20억 개로 되어있습니다. USM은 Youtube에서도 사용가능하게끔 만들 예정이며 실 test를 진행했을때 18개 언어만을 가능한 Whisper보다 오류율이 낮고 73개국어를 적용가능하다는 점에서는 타 모델보다 비교불가능하다 볼 수 있습니다. 현재 API access신청을 받고 있으니 관심 있는 분들은 연결해서 사용하는 것을 추천합니다!
구글이 2023년 ICDAR 2023에서 계층적 텍스트 감지와 인식 경연대회를 개최합니다. 해당 대회의 주제는 OCR과 병행되는 레이아웃 분석입니다. 현재 OCR 연구와 레이아웃 분석은 시너지를 못내고 있지만 구글은 이번 대회를 통해 상호 보완된다고 믿고 있습니다. 이 대회는 Robust Reading Competition 웹사이트를 통해 진행됩니다. 이 블로그를 보고 네이버 클로바가 떠올랐습니다. 네이버 클로바는 2019년에 같은 컨퍼런스 대회에서 4개 분야 1위를 거머쥐었습니다. 그리고 해당 연구는 CLOVA OCR를 만드는 단초가 되었습니다. OCR에 관심 있는 기업들은 해당 대회를 통해 진행해서 우수한 성과를 가져가는 것도 좋을 것 같습니다!!
