[2300914] 모두의연구소가 전하는 “모두를 위한 AI 뉴스” - 교과서로만 공부했어요!
🩵모두의연구소는 함께 공유하고 성장하는 국내 최대 AI 커뮤니티입니다.
그럼, 오늘의 AI 뉴스 시작해 볼게요! :)
TinyStories와 phi-1 모델의 연속적인 연구를 통해 소규모 Transformer 기반 언어 모델의 성능에 대한 연구를 진행했습니다. 대규모 언어 모델을 사용해 ‘교과서 수준의’ 데이터 생성을 제안하며, 자연어의 상식 추론을 중심으로 ‘교과서만 있으면 된다’는 전략을 채택했다고 하는데요!
이로 인해 자연어 작업에서 5배 큰 모델과 유사한 성능을 가지며, 복잡한 추론 작업에서는 기존 모델을 능가하는 13억 개의 파라미터 모델인 phi-1.5를 개발했습니다. phi-1.5는 큰 언어 모델의 많은 특성을 갖지만, 웹 데이터의 부재로 인한 개선된 측면을 보여주는 데요! phi-1.5를 오픈소스로 공개했다고 하니 깃허브를 꼭 확인해보세요!
2️⃣NExT-GPT: 범용 다중모달 언어 모델로 인간 수준 AI 구축
다중모달 대규모 언어 모델(MM-LLM)은 발전을 이루었지만, 여러 모달리티로 콘텐츠를 생성하는 능력이 제한적이죠. 인간과 유사한 AI를 구축하기 위해 해당 논문에 NExT-GPT라는 엔드투엔드 범용 애니투애니 MM-LLM 시스템이 개발됐다고 합니다!
이 시스템은 텍스트, 이미지, 비디오, 오디오 등 다양한 출력을 생성할 수 있으며, 특정 프로젝션 레이어의 소량의 파라미터만으로 튜닝 가능하여 비용 절감 및 확장성이 우수합니다. 모달리티 전환 인스트럭션 튜닝을 도입해 교차 모달 의미 이해 및 콘텐츠 생성을 강화하였습니다. 이 연구는 인간과 유사한 AI 연구의 가능성을 보여준다고 하니 자세한 내용은 링크에서 확인해보세요!
3️⃣VITS2: 개선된 단일 단계 텍스트 음성합성 모델의 소개
최근 단일 단계 텍스트 음성 변환 모델은 두 단계 파이프라인을 능가하는 성능을 보이고 있지만, 부자연스러움, 계산 효율성, 음소 변환의 의존도 등의 문제가 있습니다. 이 연구에서는 이러한 문제를 개선한 단일 단계 텍스트 음성합성 모델 VITS2를 제안했는데요. VITS2는 개선된 구조와 훈련 메커니즘을 통해 음성의 자연스러움과 효율성을 향상시키며, 음소 변환에 대한 의존도도 크게 줄었다고 하니 앞으로 음성 모델에 대한 기대감이 커지네요!
⎯
📍 국내 최대 AI 커뮤니티 모두의연구소가 60명⁺ AI 현업 전문가와 독자&공동 개발!
AI학교 아이펠 7기 무료 입학하기! → https://bit.ly/44cSNkr

