
AI 보조자 우위를 위한 경쟁에는 기술적으로 새로운 리더가 있으며, 바로 Anthropic의 새로운 Claude 3.5 Sonnet입니다. 새로 출시된 모델은 다양한 벤치마크 테스트에서 Gemini 1.5 Pro와 ChatGPT-4o를 모두 능가한다고 회사가 목요일에 발표했습니다 .
Sonnet의 이 새로운 반복은 Anthropic의 곧 출시될 3.5 모델 라인 중 첫 번째이며, 더 광범위한 Opus 3.0 모델 보다 훨씬 뛰어난 성능을 발휘하며 더 큰 모델의 에너지 비용의 일부만 사용합니다. 컴퓨팅 효율성은 AI 시스템 설계에서 점점 더 중요한 측면이 되고 있습니다. 특히 인프라가 기가와트 범위로 확장되는 동안 AI 데이터 센터에 전력을 공급하고 냉각하는 비용이 급증함에 따라 더욱 그렇습니다.
Anthropic 팀은 블로그 게시물에 “Claude 3.5 Sonnet은 Claude 3 Opus보다 두 배 빠른 속도로 작동합니다.”라고 썼습니다. "이러한 성능 향상과 비용 효율적인 가격 덕분에 Claude 3.5 Sonnet은 상황에 맞는 고객 지원 및 다단계 작업 흐름 조정과 같은 복잡한 작업에 이상적입니다."
새로운 모델은 GPQA를 통한 대학원 수준 추론, MMLU를 통한 학부 수준 지식, HumanEval을 통한 코딩 능력 등 세 가지 표준화된 테스트에서 벤치마크 결과를 설정한 것으로 알려졌습니다. 이는 Google의 Gemini 1.5 Pro, Meta의 Llama-400b 및 OpenAI의 ChatGPT-4o를 능가했지만 큰 차이는 아니며 일반적으로 몇 퍼센트 포인트 차이에 불과했습니다.

Sonnet 3.5는 Anthropic의 "아직 가장 강력한 비전 모델"로 평가받고 있습니다. ” 차트와 그래프를 해석하거나 스크린샷이나 스캔한 영수증과 같은 불완전한 이미지 소스의 텍스트를 복사하는 등 다양한 비전 기반 작업을 Opus 3.0보다 더 정확하게 수행할 수 있습니다. 실제로 Sonnet 3.5는 업계 표준 비전 벤치마크에서 Opus 3.0을 6~17포인트 앞섰습니다. 새로운 모델은 또한 유머를 다루는 능력이 훨씬 더 뛰어나고 훨씬 더 생생한 방식으로 대화할 수 있는 것으로 알려졌습니다.
Sonnet은 또한 사용자에게 Artifacts 기능을 제공하는 최초의 Anthropic AI가 될 것입니다. 대화 흐름에 직접 이미지나 코드 조각을 생성하는 대신 Artifacts는 채팅 측면의 전용 공간에 해당 콘텐츠를 생성합니다. 이를 통해 사용자는 "Claude의 창작물을 실시간으로 보고, 편집하고, 구축할 수 있는 동적 작업 공간을 만들고 AI 생성 콘텐츠를 프로젝트와 작업 흐름에 원활하게 통합할 수 있습니다"라고 Anthropic 팀은 주장합니다. 또한 Claude가 주문형 보조자 역할을 하면서 회사가 단일 중앙 사일로에 데이터, 문서 및 프로젝트를 저장할 수 있는 팀 협업을 곧 지원할 것이라고 발표했습니다.
지금 Claude.ai 웹사이트와 Claude iOS 앱에서 Claude 3.5 Sonnet을 무료로 사용해 볼 수 있습니다(Claude Pro 또는 Team 구독을 이용하면 훨씬 더 높은 속도 제한이 적용됩니다). Anthropic API, Amazon Bedrock 및 Google Cloud의 Vertex AI를 통해서도 타사 통합이 가능합니다. Claude Haiku 3.5와 Opus 3.5는 올해 후반에 출시될 예정입니다.
