[230314] AI 개발자라면 알아야 하는 데일리 뉴스 - ChatGPT에 대응하는 모델들
안녕하세요
국내 최대 오프라인 AI 커뮤니티 모두의연구소입니다.
ChatGPT가 불러일으킨 혁명으로 인해서 다른 빅테크들도 대응하고 있습니다.
그중에서 메타 AI는 LLaMA라는 모델을 오픈소스화시키면서 (현재 연구 한정이지만 나중에는 오픈소스화시킬 예정) 연구 붐이 일어나고 있습니다.
오늘 전해드릴 소식은 오늘 하루동안 일어났으며 실제 현업 엔지니어들이 팔로업이 안될 정도로 빠르게 발전하고 있습니다.
오늘 소개할 딥러닝 모델은 LLaMA - alphaca입니다. LLaMA는 페이스북으로 유명한 메타 AI에서 만든 GPT-3.5와 같습니다. GPT-3.5만을 사용하게 된다면 ChatGPT처럼 챗봇기능을 완벽히 수행할 수 없습니다. LLaMA 또한 마찬가지입니다. 특히 LLaMA의 경우 거대모델을 작게 만드는데 성공했지만 품질에 대해서는 아직 검증이 되어 있지 않았습니다. Alphaca는 LLaMA 모델시리즈중에서 작은 모델을 기준으로 스탠포드가 미세조정했고 해당 모델이 ChatGPT급으로 성능이 좋아졌습니다. 현재는 모델이나 코드가 공개되지 않았고 데모만 공개했는데 상당히 품질이 좋아 공유합니다.
Alphaca가 공개된지 불과 10시간만에 경량화 기법이 들어간 모델이 공개되었습니다. LoRA란 마이크로소프트에서 개발했으며 이미 만들어진 모델의 가중치를 얼리고 학습 가능한 층을 넣는걸 의미합니다. 해당 내용은 diffusion 모델에도 사용하고 있는데 최신 기법을 하루도 지나지 않았는데 개발되었다는 것이 놀랐습니다. 딥러닝 쪽은 정말 하루하루가 업데이트되는 세상이라 딥러닝 엔지니어분들도 정신없이 흘러가고 있는 상황입니다
모두의연구소는 함께 공유하고 성장하는 연구 문화를 전파합니다
지난 AI뉴스 모두보기 ⇒ https://page.stibee.com/archives/181723
