
지난 6개월 동안 대형 모델의 추세는 지속적으로 규모를 추구하던 이전 추세와 달리 더 작고 강한 엔드 투 사이드 모델이 추세로 자리 잡았습니다.
국내 대표 모델 제조사인 페이스월 인텔리전스는 얼마 전 스탠퍼드대 AI팀에 표절당한 뒤 존재감을 대폭 강화하며 AI 분야에서 이 회사의 남다른 강점을 국내외에 알리기도 했다.
오늘 Wallface Intelligence는 새로운 "작은 강철 대포" MiniCPM-V 2.6 모델을 출시하여 최종 다중 모드 기능을 다시 한 번 새로운 수준으로 끌어올렸습니다.
모델에는 8B 매개변수만 있지만 20B 미만의 단일 이미지, 다중 이미지 및 비디오 이해에서 3개의 SOTA 결과를 달성하여 포괄적인 벤치마킹에서 최종 AI의 다중 모드 기능을 GPT-4V 이상의 수준으로 높였습니다.
간단히 강조 표시하십시오.
- 처음으로 장치 측의 단일 이미지, 다중 이미지 및 비디오 이해와 같은 다중 모드 핵심 기능이 GPT-4V를 완전히 능가했으며 단일 이미지 이해는 Gemini 1.5 Pro 및 GPT-4o mini를 뛰어 넘었습니다.
- 실시간 영상이해, 다중이미지 합치기, ICL 시각학습, OCR 등을 도입하여 엔드사이드 모델의 실제 관찰 및 학습이 가능합니다.
- Xiaogangpao 2.6은 GPT-4o의 단일 토큰 인코딩 픽셀 밀도를 두 배로 늘렸습니다. 시각적 토큰은 이전 세대보다 30% 낮고 유사 모델보다 75% 낮습니다.
- 정량화된 백엔드 측 메모리는 6GB만 차지하며, 종단 추론 속도는 18토큰/초로 이전 세대 모델보다 33% 빠릅니다. 그리고 출시 시 llama.cpp, ollama, vllm 추론을 지원하고 여러 언어를 지원합니다.
스마트 기기가 당신을 더 잘 이해할 수 있게 해주는 실시간 영상 이해 '롱 아이즈'가 최초로 출시되었습니다.
먼저 MiniCPM-V 2.6 모델의 실제 시연 효과를 경험해 보겠습니다.
비디오는 다중 모드 기능을 지원하는 MiniCPM-V 2.6이 한 쌍의 "눈"을 갖는 것과 같으며 실시간으로 현실 세계를 볼 수 있음을 보여 줍니다. 비행 모드를 켜면 이 모델이 탑재된 엔드사이드 기기는 벽면을 향한 스마트 기업의 실내 장면을 정확하게 식별할 수 있다.
벽면을 바라보는 스마트 기업의 로고부터 식물, 책상, 정수기 등 물품까지 MiniCPM-V 2.6의 물품인식 기능은 스트레스 없이 쉽다고 할 수 있습니다.
수많은 영수증이 있는 회계 또는 환급 프로세스에 직면하면 사진을 찍어 MiniCPM-V 2.6에 업로드하기만 하면 됩니다. 각 영수증의 구체적인 금액을 식별할 수 있을 뿐만 아니라 총액도 계산할 수 있으므로 전체 프로세스가 크게 단순화됩니다. .
MiniCPM-V 2.6은 고급 OCR 및 CoT(Chain of Thought) 기술 덕분에 영수증의 금액을 정확하게 캡처할 수 있을 뿐만 아니라 문제 해결 프로세스를 명확하고 간결하게 제시할 수 있습니다.
"보기에 너무 긴" 비디오의 경우 이제 모델이 직접 핵심 정보를 추출하도록 할 수 있습니다.
예를 들어 MiniCPM-V 2.6은 약 1분 분량의 일기예보 영상을 볼 때 "육안"을 사용하여 조용한 조건에서 여러 도시의 특정 기상 조건을 식별하고 설명할 수 있습니다.
MiniCPM-V 2.6의 최종 다중 모드 복합 추론 기능도 "향상"되었습니다.
MiniCPM-V 2.6은 GPT-4V의 고전적인 공식 시연인 자전거 시트 조정을 예로 들어 다중 휠 대화를 통해 사용자에게 자전거 시트를 낮추도록 명확하게 안내하고 지침과 도구 상자를 기반으로 적절한 도구를 추천할 수 있습니다.

또는 2G 인터넷에 연결되어 있고 젊은 사람들이 널리 퍼뜨리는 밈을 이해할 수 없다면 밈 뒤에 숨어 있는 결함을 인내심 있게 설명하도록 하는 것이 좋습니다.

심지어 인간보다 더 유머러스할 수도 있고 밈의 하위 텍스트를 포착할 수도 있습니다. 프로그래머로서 여러분은 이 사진을 보고 웃고 울 수도 있습니다.

작은 승리가 큰 MiniCPM-V 2.6은 3가지 기능 중 가장 강력한 최종 다중 모드로 알려져 있습니다.
기기측 모델의 핵심 경쟁력은 작은 것에서 큰 차이를 만드는 것입니다.
Wallface Intelligence의 공식 소개에 따르면 MiniCPM-V 2.6의 지식 압축률 측면에서 MiniCPM-V 2.6은 GPT-4o의 두 배에 달하는 가장 높은 다중 모드 대형 모델 픽셀 밀도(토큰 밀도)를 달성했습니다.
토큰 밀도 = 인코딩 픽셀 수/비주얼 토큰 수는 단일 토큰이 전달하는 픽셀 밀도, 즉 이미지 정보의 밀도를 나타내며 다중 모드 모델의 실제 작동 효율성을 직접적으로 결정합니다. 값이 높을수록 모델의 운영 효율성이 높아집니다.

비공개 소스 모델의 토큰 밀도는 API 과금 방법으로 추정됩니다. 결과는 MiniCPM-V 2.6이 모든 다중 모드 모델 중에서 가장 높은 토큰 밀도를 가지며, 극도의 효율성이라는 일관된 특성을 유지한다는 것을 보여줍니다.
공유된 벤치마크 테스트 결과에 따르면 MiniCPM-V 2.6은 권위 있는 종합 평가 플랫폼 OpenCompass의 단일 이미지 이해 기능에서 Gemini 1.5 Pro 및 GPT-4o mini를 능가합니다.
다중 그래프 평가 플랫폼 Mantis-Eval 목록에서 MiniCPM-V 2.6의 다중 그래프 공동 이해 기능은 오픈 소스 모델 SOTA를 구현하고 GPT-4V를 능가합니다. 비디오 평가 플랫폼 Video-MME 목록에서 MiniCPM-V 2.6의 비디오 이해 기능은 GPT-4V를 능가하여 최종 SOTA에 도달합니다.

▲OpenCompass | Mantis-Eval | 비디오-MME 목록 결과
또한 MiniCPM-V 2.6 OCR 성능은 OCRBench에서 오픈 소스 + 폐쇄 소스 모델 SOTA를 구현합니다.
환각 평가 목록 Object HalBench에서는 MiniCPM-V 2.6의 환각 수준(환각 비율이 낮을수록 좋음)도 GPT-4o, GPT-4V, Claude 3.5 Sonnet 등 많은 상용 모델보다 우수합니다.

▲Obiect HalBench OCRBench 목록 결과 |
차세대 소형 강철 총 MiniCPM-V 2.6이 뛰어난 성능을 발휘하는 이유는 주로 통합된 고화질 시각적 아키텍처를 채택했기 때문입니다.
관계자들은 통합된 고화질 시각적 프레임워크가 전통적인 단일 이미지의 다중 모드 장점을 계승할 뿐만 아니라 원스톱 커뮤니케이션을 달성한다고 밝혔습니다.
예를 들어, OCR SOTA 기능은 MiniCPM-V의 단일 이미지 장면에 대한 "180만 고화질 이미지 분석"의 기능과 지식 공유를 마이그레이션하고 이를 다중 이미지 장면과 비디오 장면으로 원활하게 확장하며 이 세 가지 시각적 이해를 통합합니다. 대체 텍스트의 의미론적 모델링 문제를 해결하고 기본 시각적 표현 메커니즘을 공유하며 유사한 모델에 비해 시각적 토큰 수를 75% 이상 절약합니다.

MiniCPM-V 2.6은 OCR 정보 추출을 기반으로 테이블 정보에 대해 CoT(Chain of Thought)와 유사한 복잡한 추론을 추가로 수행할 수 있습니다.
2008년 올림픽을 예로 들어 모델은 금메달을 가장 많이 획득한 3개국이 획득한 총 금메달 수를 계산할 수 있었습니다.
[그림]
이 프로세스에는 다음이 포함됩니다.
- OCR 기능을 사용하여 메달 테이블에서 가장 많은 금메달을 획득한 상위 3개 국가를 식별하고 추출합니다.
- 세 나라의 총 금메달 수를 더해보세요.
AI 신뢰성 측면에서 MiniCPM-V 2.6은 8.2%의 환상률로 Xiaogangpao 시리즈의 전통적인 장점을 이어갑니다. 또한 벽면형 RLAIF-V 정렬 기술과 Ultra 시리즈 정렬 기술 적용도 MiniCPM-V 2.6 뒤에 숨겨진 블랙 기술입니다.

공식 데이터에 따르면 Xiaogangpao 시리즈의 다운로드 수가 100만 건을 넘었습니다. 최초의 멀티모달 기능인 엔드사이드 배포 출시부터 가장 강력한 엔드사이드 멀티모달 모델, 포괄적인 엔드사이드 GPT-4V 벤치마킹의 새로운 시대에 이르기까지 벽면 인텔리전스는 단 6년 만에 완료되었습니다. .
"똑똑하고, 매끄럽고, 너무 빨라서 엔드 투 엔드 모델이 아닌 것 같아요!" 이 문장은 소형 강철 총 시리즈에 대한 가장 적절한 설명입니다.
Wall-Facing Intelligence에 더 많은 시간을 주고, 국내외 대형 모델 제조업체에도 더 많은 시간을 주어야 합니다. 우리는 Wall-Facing Intelligence가 앞으로도 더 고품질의 최종 AI 모델을 계속 출시하고 국내와 협력할 것이라고 굳게 믿습니다. 엔드사이드 AI 개발을 촉진하기 위해 외국 대형 모델 제조업체와 협력합니다.
이 과정에서 독립개발자와 일반 사용자가 가장 큰 수혜자가 될 것이다.
마지막으로 MiniCPM-V 2.6 오픈 소스 주소가 첨부됩니다.
GitHub
https://github.com/OpenBMB/MiniCPM-V
포옹하는 얼굴:
https://huggingface.co/openbmb/MiniCPM-V-2_6
# Aifaner: Aifaner(WeChat ID: ifanr)의 공식 WeChat 공개 계정을 팔로우하신 것을 환영합니다. 더 흥미로운 콘텐츠가 최대한 빨리 제공될 예정입니다.
Ai Faner | 원본 링크 · 댓글 보기 · Sina Weibo

