Gemini 2.0 소개: 에이전트 시대를 위한 새로운 AI 모델
원문: https://blog.google/technology/google-deepmind/google-gemini-ai-update-december-2024/
요약 by chatgpt
Gemini 2.0의 핵심 주요 기능
네이티브 멀티모달 기능
텍스트, 이미지, 비디오, 오디오, 코드 등 다양한 데이터 유형을 이해하고 처리.
네이티브 이미지 생성 및 조정 가능한 다국어 텍스트-음성 변환(TTS) 지원.
네이티브 도구 사용: Google 검색, 코드 실행, 타사 사용자 정의 함수 등.
고급 추론 및 긴 컨텍스트 처리
복잡한 주제 및 다단계 질문 처리.
고급 수학 방정식, 멀티모달 쿼리, 코딩 문제 해결 능력 향상.
새로운 에이전트 모델
사용자의 세상을 더 깊이 이해하고 여러 단계 앞서 계획.
복잡한 작업을 수행하고 사용자 감독 아래 조치를 취할 수 있는 능력.
향상된 성능 및 낮은 지연 시간
1.5 Pro 대비 2배 빠른 응답 속도.
실시간 오디오 및 비디오 스트리밍 입력 지원.
Deep Research 기능
고급 추론 및 긴 컨텍스트를 활용한 연구 보조원 역할.
복잡한 주제를 탐색하고 보고서를 자동으로 컴파일.
개발자를 위한 API 및 툴 제공
Gemini API: Google AI Studio 및 Vertex AI를 통해 접근 가능.
Multimodal Live API: 실시간 오디오, 비디오 스트리밍, 복합 도구 사용 지원.
차세대 프로젝트
Project Astra: 일상에서 유용한 보편적 AI 어시스턴트 기능 제공.
Project Mariner: 브라우저 내 복잡한 작업 수행을 위한 에이전트.
Jules: GitHub 워크플로우 통합 코딩 지원 에이전트.
책임감 있는 AI 개발
AI 안전 및 보안 강화.
사용자 프라이버시 보호 및 민감한 정보 공유 방지.
악의적 명령 및 피싱 시도를 차단하는 보호 메커니즘 구축.
게임 및 물리적 세계 적용
게임 내 가상 세계 탐색 및 규칙 해석.
물리적 환경에서 도움이 되는 로봇 에이전트 개발 실험.
기술적 기반
Google DeepMind의 맞춤형 하드웨어 6세대 TPU Trillium 기반으로 학습 및 추론.
AI 혁신을 위한 풀스택 접근 방식 적용.