GPT-4o와 Gemini 1.5 Pro가 AI 경쟁에서 승리했습니다.

8비트 크랩이 포함된 claude 3.5 소네트의 스크린샷
인류학

AI 보조자 우위를 위한 경쟁에는 기술적으로 새로운 리더가 있으며, 바로 Anthropic의 새로운 Claude 3.5 Sonnet입니다. 새로 출시된 모델은 다양한 벤치마크 테스트에서 Gemini 1.5 Pro와 ChatGPT-4o를 모두 능가한다고 회사가 목요일에 발표했습니다 .

Sonnet의 이 새로운 반복은 Anthropic의 곧 출시될 3.5 모델 라인 중 첫 번째이며, 더 광범위한 Opus 3.0 모델 보다 훨씬 뛰어난 성능을 발휘하며 더 큰 모델의 에너지 비용의 일부만 사용합니다. 컴퓨팅 효율성은 AI 시스템 설계에서 점점 더 중요한 측면이 되고 있습니다. 특히 인프라가 기가와트 범위로 확장되는 동안 AI 데이터 센터에 전력을 공급하고 냉각하는 비용이 급증함에 따라 더욱 그렇습니다.

클로드 3.5 비전을 위한 소네트

Anthropic 팀은 블로그 게시물에 “Claude 3.5 Sonnet은 Claude 3 Opus보다 두 배 빠른 속도로 작동합니다.”라고 썼습니다. "이러한 성능 향상과 비용 효율적인 가격 덕분에 Claude 3.5 Sonnet은 상황에 맞는 고객 지원 및 다단계 작업 흐름 조정과 같은 복잡한 작업에 이상적입니다."

새로운 모델은 GPQA를 통한 대학원 수준 추론, MMLU를 통한 학부 수준 지식, HumanEval을 통한 코딩 능력 등 세 가지 표준화된 테스트에서 벤치마크 결과를 설정한 것으로 알려졌습니다. 이는 Google의 Gemini 1.5 Pro, Meta의 Llama-400b 및 OpenAI의 ChatGPT-4o를 능가했지만 큰 차이는 아니며 일반적으로 몇 퍼센트 포인트 차이에 불과했습니다.

다른 주요 AI 시스템과 비교하여 Claude 3.5 Sonnet의 성능을 보여주는 표입니다.
인류학

Sonnet 3.5는 Anthropic의 "아직 가장 강력한 비전 모델"로 평가받고 있습니다. ” 차트와 그래프를 해석하거나 스크린샷이나 스캔한 영수증과 같은 불완전한 이미지 소스의 텍스트를 복사하는 등 다양한 비전 기반 작업을 Opus 3.0보다 더 정확하게 수행할 수 있습니다. 실제로 Sonnet 3.5는 업계 표준 비전 벤치마크에서 Opus 3.0을 6~17포인트 앞섰습니다. 새로운 모델은 또한 유머를 다루는 능력이 훨씬 더 뛰어나고 훨씬 더 생생한 방식으로 대화할 수 있는 것으로 알려졌습니다.

Sonnet은 또한 사용자에게 Artifacts 기능을 제공하는 최초의 Anthropic AI가 될 것입니다. 대화 흐름에 직접 이미지나 코드 조각을 생성하는 대신 Artifacts는 채팅 측면의 전용 공간에 해당 콘텐츠를 생성합니다. 이를 통해 사용자는 "Claude의 창작물을 실시간으로 보고, 편집하고, 구축할 수 있는 동적 작업 공간을 만들고 AI 생성 콘텐츠를 프로젝트와 작업 흐름에 원활하게 통합할 수 있습니다"라고 Anthropic 팀은 주장합니다. 또한 Claude가 주문형 보조자 역할을 하면서 회사가 단일 중앙 사일로에 데이터, 문서 및 프로젝트를 저장할 수 있는 팀 협업을 곧 지원할 것이라고 발표했습니다.

지금 Claude.ai 웹사이트와 Claude iOS 앱에서 Claude 3.5 Sonnet을 무료로 사용해 볼 수 있습니다(Claude Pro 또는 Team 구독을 이용하면 훨씬 더 높은 속도 제한이 적용됩니다). Anthropic API, Amazon Bedrock 및 Google Cloud의 Vertex AI를 통해서도 타사 통합이 가능합니다. Claude Haiku 3.5와 Opus 3.5는 올해 후반에 출시될 예정입니다.


게시됨

카테고리

작성자

태그: