
황푸강에서 개최된 2024년 세계 인공지능 회의에서는 기업가, 개발자, 기술 애호가들이 상하이의 38도 열기보다 더 뜨거운 열광을 펼쳤습니다. 대형 모델의 혁명적 성격과 실제 응용의 비호환성에 대한 의견이 나왔습니다. 또한 새로운 스파크를 생성합니다.
대형 모델의 컴퓨팅 성능을 어떻게 생산성으로 전환할 수 있나요?
대형 모델, 칩, 클라우드 컴퓨팅, 구현된 지능, 자율 주행 및 기타 제조업체가 최신 성과를 모아 중국 AI 환경의 축소판을 형성할 때 이곳에 오는 모든 사람은 AGI로 이어지는 풀뿌리를 찾기를 희망합니다.

"이 회사는 OpenAI와 많이 닮은 회사입니다." Zhipu AI 부스 앞에 있었는데, 한 전시회 방문객이 동료들에게 이를 소개하는 것을 들었습니다. 이는 아마도 많은 실무자들의 견해일 것입니다.
이 중국 AI 유니콘은 다양한 크기의 일반 대형 모델을 보유하고 있으며 최근 Llama 3 8b 모델을 능가하는 GLM-4-9B 모델을 출시했습니다. 다중 모드 모델 GLM-4V-9B는 매개변수 양이 13B인 GPT-4V와 동일한 기능을 달성합니다. 어제 Zhipu AI는 WAIC에서 4세대 CodeGeeX 코드 모델 CodeGeeX4-ALL-9B도 출시했습니다.

Zhipu AI의 상용화 속도도 대부분의 경쟁사보다 앞서 있습니다. 현재 Qingyan APP에서 사용할 수 있는 에이전트는 300,000개 이상입니다. Zhipu AI 대형 모델 개방형 플랫폼에는 현재 400,000명이 넘는 등록 사용자가 있으며, 일일 평균 통화량은 600억 개의 토큰에 달합니다.

Zhipu AI의 CEO인 Zhang Peng은 현재 대형 모델로 인한 AI 열풍은 과거에는 AI 기술이 일부 실질적인 문제를 해결했지만 오늘날의 대형 모델 개발은 인간과 유사한 인지 능력을 더욱 중요하게 만들었다고 믿습니다. .
대형 모델은 일련의 시나리오와 애플리케이션의 다양한 요구 사항을 해결하기 위해 하나의 모델에 대한 일반화 기능을 제공함으로써 비용과 이익의 균형 문제를 해결할 수 있는 필수 기능입니다.
Zhang Peng은 또한 현장에서 APPSO 및 기타 미디어와의 인터뷰를 수락하여 대형 모델 구현, 슈퍼 애플리케이션 및 기술의 미래 곡선과 같은 주제에 대해 이야기하고 대형 모델 연구에서 상용화에 이르기까지 몇 가지 주요 문제를 다루었습니다.
다음은 중국 AI 기업이 대형 모델을 구현한 방법에 대한 일부 프로필을 볼 수 있는 대화 내용입니다.
빅 모델 구현, 슈퍼 애플리케이션에만 집중하지 마세요
Q: 대형 모델의 TPF(Technology-Problem Fit)와 관련하여 Zhipu에서는 어떻게 기술과 제품을 결합하고 구현합니까? 업계에서는 아직 이에 대한 합의에 도달하지 못했습니다.
Zhang Peng: 이 문제는 논쟁의 여지가 없다고 생각합니다. 어떤 새로운 기술을 구현하려면 주기가 필요하지만, 이 주기는 길 수도 있고 짧을 수도 있으며, 대형 모델과 같은 혁신적인 기술이 구현되면 그 과정에서 우리가 해결해야 할 더 큰 도전과 문제가 분명 있을 것입니다.
객관적인 역사적 관점에서 볼 때 이 기술 혁명의 구현은 충분히 빨랐지만 정확하게는 속도가 너무 빠르기 때문에 이 문제에 대한 모든 사람의 이해가 여전히 다소 불균등하고 분포의 차이가 상대적으로 큽니다.
기술은 여전히 빠르게 반복되고 업데이트되어야 하지만, 적용 측면에서는 구현하기 전에 완전히 성숙될 때까지 기다릴 수 없습니다 .
Q: 대형 모델 구현 경험을 공유해 주실 수 있나요?
Zhang Peng: 우선 이 모델을 인식하는 능력에 대해 깊은 이해가 있어야 합니다. 예를 들어 모델에게 매우 정확한 물리적 모델이나 수학적 공식을 계산하도록 요청하면 인간의 두뇌와 마찬가지로 잘하지 못하기 때문입니다. 가혹하게 하면 안 된다.
예를 들어, 익숙했던 계산기를 대치하는 용도로 사용하는 것은 적절하지 않기 때문에 그 장점을 최대한 발휘할 수 있는 적절한 각도를 찾아야 하며, 반대 방향으로 가거나 공간을 막지 않아야 한다. 모델 기능이 언제든지 손상될 수 있으므로 개발 경로가 중단되었습니다.
Q: 최근 모두가 논의하고 있는 AI 슈퍼 애플리케이션과 우리는 얼마나 멀리 떨어져 있는가? 실제로 일일 활성 사용자 수가 천만 명 이상인 AI 애플리케이션은 거의 없습니다.
Zhang Peng: 슈퍼 애플리케이션에 대한 모든 사람의 정의는 매우 모호합니다. 모든 사람은 자신만의 아이디어를 가지고 있습니다. ChatGPT는 슈퍼 애플리케이션으로 간주됩니까?
Q. 어떤 비유와 비교되는지 살펴볼까요?
Zhang Peng : 네, 항상 비유를 해야 해요. ChatGPT는 이미 월간 사용자 수가 1억 명을 넘는 역사상 가장 빠른 제품입니다. 이것이 슈퍼 애플리케이션이라고 할 수 없다면 무엇을 슈퍼 애플리케이션이라고 부를 수 있을까요?
이 결론을 성급하게만 보지 마십시오. 프로세스를 관찰하면 매우 빠르게 발전했음을 알 수 있으므로 슈퍼 애플리케이션의 출현은 전적으로 기술 중심의 것이 아니라 다음과 같은 많은 요소를 고려합니다. 시장으로서 그리고 사용자가 준비되었는지 여부 .
또 다른 간단한 예를 들어보겠습니다. Google 검색 엔진의 사용자 수는 충분히 많습니다. Google이 세계 1위의 검색 엔진이 되어 성공적인 상업 경로를 찾는 데 얼마나 오랜 시간이 걸렸습니까? 현재의 메타와 오리지널 페이스북도 6년이 걸렸습니다.

Q: 모바일 인터넷이 등장한 후 WeChat과 TikTok이 등장하는 데에도 시간이 더 걸렸습니다.
Zhang Peng : 그럼 왜 다들 좀 더 기다리지 못하는 걸까요? 한번 시도해 보는 것도 좋을 것 같습니다. 우리가 어렸을 때 알카노이드 게임을 할 때처럼 틈새를 겨냥해서 아주 정확하게 틈새를 치고 싶으면 먼저 틈새가 어디에 있는지 찾아야겠죠? 길은 어디에 있습니까?
여러 가지를 차근차근 살펴보아야 할 부분이 있고, 이 과정이 매우 중요합니다. 단지 최종 결과만 보는 것이 아니라, 더 중요하게는 행동에 나서는 것이 지금으로서는 모두가 더 주목해야 할 부분이라고 생각합니다.
Q: 업계의 일부 사람들은 혁신적인 애플리케이션이 향후 몇 년 내에 구현될 것이라고 생각합니다. 그는 약 3년이라는 매우 명확한 시간을 제시했습니다.
Zhang Peng: 어쩌면 내일일 수도 있습니다. 방금 말했듯이 이 문제는 다양한 요소에 대한 종합적인 고려가 필요합니다. 하나는 기술 자체의 성숙도이고, 두 번째는 시장과 사용자 자체가 준비되어 있는지 여부입니다. 세 번째는 수요의 발견인데, 약간의 행운이라도 더해지는 변수가 너무 많고, 내 뇌처럼 단순한 신경망으로는 이런 것을 예측하기 어렵다.
Q: 최근 적용되지 않는 기본 모델은 무가치하다는 의견이 뜨거운데요.
Zhang Peng : 이 문제 자체는 두 가지 수준으로 나누어집니다. 첫째, 인간 지능의 원인을 끊임없이 탐구하는 수많은 과학 연구자들이 있기 때문에 기술 혁신은 그 자체로 의미가 있습니다.
두 번째 수준. 이러한 탐구의 결과가 우리가 그것을 엔지니어링하고 제품화하여 더 가치 있는 생산력으로 전환할 수 있다면 그것은 더 큰 의미가 있을 것입니다 .
이 문제는 둘 중 하나의 선택이 아니라 일련의 문제이다. 물론 적용은 매우 중요합니다. 우리는 오늘날 기술이 더욱 새로운 생산성으로 변모할 수 있기를 바랍니다. 하지만 그렇다고 해서 기술 혁신과 본질적인 탐구를 추구하는 것이 가치가 없다는 의미는 아닙니다. 극단적으로 가지 마십시오. 서로 강화되는 관계입니다.
Q: 오픈소스 모델은 대부분의 애플리케이션 시나리오에 적합하지 않으며, 상용 폐쇄소스 모델이 가장 효과적이라는 견해도 있습니다. 얼마 전 Zhipu는 GLM-4의 오픈 소스 버전도 출시했습니다. 오픈 소스 및 폐쇄 소스 모델 문제에 대해 어떻게 생각하시나요?
Zhang Peng : 우리는 오픈 소스와 폐쇄 소스가 서로 다른 본질적인 목표와 의미를 가지고 있다고 항상 믿어왔습니다. 클로즈드 소스는 상업적인 관점에서 더 많이 고려되며, 더 나은 서비스와 더 안전한 제품을 제공하기 위한 사업 경로입니다. 대형 모델의 오픈 소스는 주로 생태계를 풍요롭게 하고 기술 혁신을 촉진하는 것이 목적입니다.
어떤 기술이 단순히 폐쇄적이고 독점적인 발전 경로를 따른다면 활력이 부족하거나 전체 생태계에 우호적이지 않은 상태가 될 것입니다 . 생물권과 마찬가지로 오픈소스도 기술 혁신과 기술적 다양성을 유지하는 데 더 중점을 두므로 오픈소스 커뮤니티도 기술의 핵심에 투자할 수 있습니다.
Q: 이전에 Zhipu의 상용화 초점이 ToB에 있다고 말씀하셨는데, 현재 ToB 고객들이 주력하고 있는 산업은 무엇입니까? 어떤 특정 애플리케이션을 고객에게 지원합니까?
Zhang Peng: 이는 우리의 현재 주요 수입원이 여전히 ToB 측에 있다는 것을 의미할 뿐, 우리의 상용화 경로가 ToB에만 있다는 것을 의미하지는 않습니다.
현재 우리가 서비스를 제공하는 B-side 고객은 금융, 교육, 인터넷, 소매, 자동차, 에너지, 전통 제조 등을 포함한 10개 이상의 산업을 포괄합니다.
우리는 현재 업계 고객의 시작을 돕고 있으며 주로 여러 경로를 사용합니다.
우선, 우리는 고객이 상대적으로 저렴한 비용으로 모델 기능에 빠르게 액세스할 수 있도록 지원하는 자체 개방형 플랫폼을 보유하고 있으며, 이를 통해 스스로 업데이트하고 자체 제품과 AI 역량 강화를 반복할 수 있습니다.
두 번째는 상대적으로 높은 데이터 보안 및 민영화 요구 사항을 가진 일부 대기업을 위한 것입니다. 클라우드 민영화 솔루션과 현지 민영화 솔루션을 제공한 다음 일부 시나리오에 대해 구체적으로 설명하고 소규모 기업을 위한 솔루션도 제공할 것입니다. 이처럼 우리는 소프트웨어와 하드웨어 통합 솔루션을 제공하겠습니다.
현재 우리의 개방형 플랫폼 에는 우리 플랫폼에 모델 API를 등록하고 사용하는 일부 소규모 개발자 팀을 포함하여 400,000명이 넘는 기업 사용자가 있습니다. 일일 서비스 양은 이제 600억 개를 초과합니다. 서비스 양은 매우 빠르게 증가하고 있습니다.

Q: OpenAI는 최근 중국 개발자에게 API 서비스 제공을 중단했고, Zhipu는 곧 재배치 서비스를 시작했습니다. 현재 중국으로 이주하는 사용자 상황은 어떻습니까?
Zhang Peng: 우리가 관찰한 바에 따르면 증가하고 있지만 전체 시장의 반응에는 과정이 있습니다. 친구들에게도 상황에 대해 물었습니다. 실제로 모두가 증가하는 것을 관찰했습니다.
Q. 앞으로 해외 진출 계획이 있나요?
Zhang Peng: 우리는 이미 국제 비즈니스 라인을 구축하고 있으며 현재 일부 비즈니스에 대해 협상 중입니다.
대형 모델의 다음 단계는 어디입니까?
Q: GPT-5가 지연되면서 대형 모델의 반복 곡선이 둔화되고 있다고 업계에서는 보고 있습니다.
Zhang Peng: 초기 스케일링 법칙은 매우 단순하고 모델의 매개변수에만 초점을 맞추었습니다. 그러나 나중에 모든 사람들이 스케일링 법칙의 의미를 발견했습니다. 매개변수의 크기는 다른 요소도 포함했습니다. 훈련에 사용되는 데이터의 양과 토큰의 개수에 대해 이야기했고 나중에 계산량과도 관련이 있다는 것을 알게 되었기 때문에 스케일링 법칙 자체의 의미도 끊임없이 변화하고 있습니다.
스케일링 법칙의 진실에 더 가까운 것은 컴퓨팅 파워와 데이터를 결합한 계산량일 수도 있고, 최종 결과는 스케일링 법칙을 더 잘 나타낼 수 있는 종합 변수일 수도 있습니다. 계산 금액의 관점에서 볼 때 Scaling Law는 여전히 유효하다고 생각합니다.
이를 증명하는 부차적인 예는 미국이 이제 AI 기술의 수출을 제한하는 것입니다. 그 제한 기준은 더 이상 칩의 컴퓨팅 성능이나 모델의 매개 변수 및 데이터의 양이 아니라 양입니다. 10의 24승을 기준으로 선을 그리면 이 모델의 계산량이 이 선을 초과하면 허용되지 않으므로 역시 진실에 가까운 방향으로 나아가고 있음을 알 수 있습니다.
그러나 그 본질은 무엇입니까? 스케일링 법칙 자체는 관찰된 현상이고 획득된 규칙이 아니기 때문에 우리는 여전히 탐구 중입니다.

Q: 앞으로 Zhipu AI는 클라이언트 측 또는 클라우드의 대형 모델을 선호합니까?
Zhang Peng: 우리는 현재의 빅 모델이 일반 인공 지능, 심지어 인간을 능가하는 슈퍼 지능으로 나아가는 것이라고 믿습니다. 이는 현재로서는 상대적으로 신뢰할 수 있는 경로이지만 우리는 클라우드나 클라이언트에만 국한되지 않을 것입니다. 편. 선택 .
우리는 이 기술의 개발에는 고유한 단계가 있다고 믿습니다. 예를 들어 일반적인 인공 지능의 다음 단계로 이동하려는 경우 클라우드는 컴퓨팅 성능 및 기타 이유로 최고 수준의 지능을 가질 수 있습니다. 지능이나 슈퍼인공지능이 발전한다. 이러한 강력한 기능을 제공하기 위해 여전히 클라우드에 중앙 집중화될 수 있습니다.

▲WAIC의 휴머노이드 로봇.
그러나 온디바이스 휴대폰, 자동차, 로봇과 같은 일부 특정 시나리오에서는 클라우드와 협력하기 위해 엔드사이드 컴퓨팅 성능과 엔드사이드 모델을 사용해야 할 수도 있습니다. 이 모델을 사용하면 미래에는 휴대폰에서 현재 클라우드만큼 스마트한 지능을 달성할 수 있지만 여기에는 칩, 컴퓨팅 성능 및 에너지와 같은 많은 포괄적인 요소와 일련의 요소가 포함됩니다. 문제.
모든 기술에는 단계가 있습니다. 이 단계에서는 계획이 이렇지만 장기적으로 보면 (기기 측과 클라우드) 궁극적인 답이 될까요? 확실히 그렇지 않습니다. 앞으로는 확실히 더 발전할 것입니다.
Q: 다음 대형 모델 개발은 어디에서 이뤄질 것이라고 생각하시나요?
Zhang Peng: 현재 대형 모델의 언어 및 글쓰기 능력은 인간의 평균 수준에 가깝거나 약간 더 높습니다. 다음으로, 우리는 이를 한 단어로 표현하기 위해 "가상에서 현실로의 이동", 즉 더 이상 통 속의 두뇌에 국한되지 않고 실제 생활에 들어가서 실제 생산성을 창출할 수 있기를 바랍니다.

이 목표를 달성하려면 언어 능력 외에도 시각 능력, 청각 능력, 손과 발을 사용하여 손과 발을 성장시키는 능력 등 많은 다른 능력이 필요합니다. 인간의 의도를 이해하고, 인간의 의도를 논리적 실행 단계로 분해하고, 도구를 사용하여 물리적 세계에 연결하여 이러한 작업을 완료할 수 있는 최첨단 모델입니다.
물리적 세계에 더 강한 간섭 능력을 갖기를 원하기 때문에, 실제 물리적 세계에서 해로운 일을 하지 않도록 보안이 더욱 중요해집니다. 이는 디지털 세계에서도 마찬가지입니다. 정렬에 관해서는 우리는 그것을 초지능(super Intelligence)과 초정렬(super alignment)이라고 부릅니다.
# Aifaner: Aifaner(WeChat ID: ifanr)의 공식 WeChat 공개 계정을 팔로우하신 것을 환영합니다. 더 흥미로운 콘텐츠가 최대한 빨리 제공될 예정입니다.
Ai Faner | 원본 링크 · 댓글 보기 · Sina Weibo
