벽면 지능 수석 과학자 Liu Zhiyuan과의 대화: 대형 모델에는 새로운 ‘무어의 법칙’이 적용되며 AGI 시대의 스마트 단말기는 반드시 휴대폰이 아닐 수도 있습니다.

지난해부터 중국 AI 업계는 거의 모든 대형 모델 기업이 GPT-4를 따라잡는 것을 목표로 하는 '수백 대 모델 전쟁'을 시작했다. 조금 엉뚱해 보이는 회사도 있는데, 바로 엔드 사이드 모델에 초점을 맞춘 벽면 인텔리전스입니다.

벽을 향한 지능은 최근 스탠포드 AI 연구팀의 표절 사건으로 인해 대중의 관심을 끌었습니다. Wall-Facing Intelligence의 수석 과학자인 Liu Zhiyuan은 당시 이 사건이 다른 관점에서 중국 혁신의 국제적 영향력을 입증했다고 썼습니다.

최근 열린 세계인공지능컨퍼런스(World Artificial Intelligence Conference)에서 페이스월(Face Wall)은 에너지 소비를 낮추고 추론 속도를 더욱 빠르게 할 수 있는 효율적인 희소 활성화 모델 MiniCPM-S를 출시했다.

Wall-facing Intelligence는 또한 2026년 말까지 GPT-4 수준의 엔드사이드 모델을 달성할 수 있을 것이라고 공개적으로 밝혔습니다.

GPT-4와 엔드측 모델을 합치면 왕짜(Wang Zha)와 동등하다.

올해에는 많은 네이티브 AI 하드웨어에 대한 의문이 제기되었으며 AI 휴대폰과 AI PC는 큰 인기를 끌었지만 소비자의 구매 결정에 거의 영향을 미치지 않습니다. 모델 및 대부분의 복잡한 기능을 완료하려면 클라우드에 의존해야 합니다.

대형 모델에 대한 열띤 논의에서 벽을 향한 지능형 "소형 강철 대포" MiniCPM은 다소 과소평가된 모델입니다. 2024년 2월에 출시된 MiniCPM 2.4B 모델은 실제로 Llama2-13b를 능가할 수 있습니다.

Wall-Facing Intelligence의 수석 과학자인 Liu Zhiyuan은 대형 모델의 시대에는 미래의 효율적인 대형 모델의 첫 번째 원칙에 대한 핵심 단어가 지식 밀도가 될 것이라고 믿습니다.

▲벽면지능(Wall-Facing Intelligence) 수석과학자 류즈위안(Liu Zhiyuan)

WAIC 2024에서 APPSO는 Liu Zhiyuan과 대화를 나누며 최종 모델이 미래의 지능형 단말기 형태에 미치는 영향, 대형 모델의 무어의 법칙을 발견하는 방법, 상아탑에서 나온 이상주의자가 어떻게 성공할 수 있는지에 대해 이야기했습니다. 비즈니스 세계의 목표는 AGI에 가깝습니다.

다음은 Liu Zhiyuan과 APPSO의 대화 내용입니다.

대형 모델 시대의 무어의 법칙

APPSO: 대규모 일반 모델을 구축하기 위해 모두가 OpenAI를 벤치마킹할 때 Wallface Intelligence가 최종 모델에 중점을 둔 이유는 무엇입니까? 내부 논란이 있습니까?

유즈위안: 사실 우리는 이미 지난해 중순에 국내 많은 대형 모델사보다 먼저 1000억 모델을 출시했다. 그러나 우리는 모델 프로세스를 지식 밀도 수준에 일치시킬지 여부를 선택해야 합니다. 당시 업계에서는 더 큰 모델을 출시하고 GPT-4에 도달하려고 노력한다는 것이 업계 합의였습니다.

기업가로서 다른 사람의 입장에서 생각하는 것은 자연스러운 일이기 때문에 우리는 이 모델을 더 크게 만들어야 하는지에 대한 내부 논의도 진지하게 진행했습니다. 그런 다음 더 많은 컴퓨팅 성능을 구입하고 몇 달 동안 이 모델을 구축하십시오.

APPSO: 결국 왜 이렇게 하지 않았나요?

Liu Zhiyuan: 우리는 먼저 모델 제조 프로세스를 개선해야 한다고 생각합니다. 우리는 모델 훈련을 예측 가능하게 만들기 위해 작년 하반기부터 모델 풍동을 구축해 왔습니다. 즉, 모델을 훈련하기 전에 이러한 데이터를 이용한 훈련이 예상 수준에 도달할 수 있는지 예측할 수 있습니다.

그래서 우리는 GPT-4를 계속 출시하지 않았습니다. 컴퓨팅 파워와 데이터, 모델 매개변수 규모를 늘리기 위해 열심히 노력하면 올해 6월쯤에는 GPT-4급 모델이 나올 것으로 예상된다. 이는 국내 대형 1차 모델 기업 모두가 달성할 수 있는 성과다. .

모두가 할 수 있고 우리도 할 수 있다면 우리의 경쟁 우위는 무엇입니까? 그래서 우리는 먼저 GPT-3.5 수준의 애플리케이션으로 시작한 다음 롤링 프로세스로 진행하기로 결정했습니다.

APPSO: 롤링 공정은 칩 제조 아이디어와 약간 비슷합니다.

Liu Zhiyuan: 사실 프로세스는 지식 밀도를 나타냅니다. 우리는 상대적으로 작은 모델을 사용한 다음 프로세스 기능을 검증하기로 결정했습니다. 그래서 저희는 당시 기기측 모델을 구축하기로 결정했습니다. 올해 초에는 2.4B 모델을 구축했습니다.

사실, 만들기 전에는 이렇게 작은 모델을 만들려면 휴대폰에서 실행되도록 만들어야 한다고 생각했어요. 물론, 휴대폰을 위한 엔드사이드 인텔리전스를 구축해야 한다고 말할 것이라고는 예상하지 못했습니다. 풍동 기술을 사용하여 만든 최종 모델은 2.4B 매개변수로 GPT-3의 1,750억 매개변수 수준에 도달할 수 있으며 Mistral 7B 및 Lama 2 13B의 효과를 벤치마킹할 수 있는 것으로 나타났습니다.

APPSO: 지식 밀도와 제조 프로세스에 대해 여러 번 언급하셨는데요. 구체적인 표준이 있나요?

Liu Zhiyuan: 예를 들어, IQ 테스트 문제 100개를 주면 몇 점을 받을 수 있나요? 컴퓨팅 성능 비용은 얼마나 되나요? 이 100개의 시험 문제를 풀 때 계산에 포함된 뉴런은 몇 개입니까? 계산에 관여하는 뉴런이 적을수록 IQ는 높아집니다. 이는 더 적은 뉴런으로 이러한 작업을 완료할 수 있기 때문입니다. 이것이 지식 밀도의 기본 개념입니다 .

두 가지 요소가 있습니다. 한 요소는 이 모델의 능력입니다. 두 번째 요소는 이 능력에 필요한 뉴런의 수 또는 해당 컴퓨팅 전력 소비입니다.

편집자 주: Liu Zhiyuan은 모델의 지식 밀도(지식 밀도 = 모델 기능/추론 컴퓨팅 전력 소비)가 평균 8개월마다 두 배로 증가할 것이라고 제안했습니다.

APPSO: 현재 대형 모델로 대표되는 일반 인공지능은 어느 단계에 있다고 생각하시나요?

Liu Zhiyuan: 우리는 물리학에서 타이코닉 시대에 있습니다. Tycho는 천체의 움직임에 관한 많은 양의 데이터를 수집했지만 이러한 천체의 움직임에 대한 실제 법칙을 찾지 못했습니다. 나중에서야 케플러의 법칙이 나타났고, 더 나중에는 뉴턴의 만유인력 법칙이 나타났습니다.

대형 모델의 개발에 속하는 만유 인력의 법칙을 찾을 수 있다면 이 법칙을 사용하여 세계 최고의 리소그래피 기계를 만들 수 있습니다 .

APPSO: OpenAI도 이 일을 하고 있나요?

Liu Zhiyuan: OpenAI는 확실히 이런 일을 하고 있습니다. 몇 년 전에 실제로 예측 가능한 확장성을 갖춘 딥 러닝 스택을 제안했기 때문입니다. 사실 이는 모델 풍동의 개념과 유사합니다. 이는 이제 많은 사람들의 공감대가 될 것입니다. 단지 OpenAI가 작년부터 공개되지 않았을 뿐입니다. 실제로 대부분의 사람들은 앞서 언급한 스케일링 법칙만 알고 나중에 실제로 수행되는 더 중요한 일을 알지 못합니다. .

APPSO: 현시점에서 어떻게 빨리 상업적 가치를 가져올 수 있을지 고민하기보다는 낮은 수준의 것들을 찾고 싶으신가요?

Liu Zhiyuan : 향후 진정한 상용화를 위해서는 대형 모델의 과학화가 전제 조건이 되어야 합니다 . 요즘에는 모두가 대형 모델과 AGI를 쫓을 때 두 가지 선택이 있습니다.

한 가지 옵션은 동일한 프로세스 또는 더 나쁜 프로세스를 사용한 다음 매우 큰 모델, 점점 더 큰 모델을 훈련한 다음 GPT-4 수준에 도달하는 것입니다. 하지만 이것이 의미가 있습니까?

우리는 작년 하반기부터 이 문제가 신빙성이 없다고 느꼈습니다. 제조 공정이 충분히 강력하지 않으면 사실상 경쟁력이 없기 때문입니다. 우리와 OpenAI 사이의 격차는 모델의 매개변수 규모가 아니라 제조 프로세스에 있습니다.

그래서 사실 올해 상반기에 모두가 이 API의 가격을 인상하기 시작했다는 것을 알게 될 것입니다. 이 문제는 별로 중요하지 않지만 이로 인해 모두가 돈을 벌 수 없게 됩니다.

거대한 모델을 교육하는 데 수천만 달러를 지출하고 이 모델의 API를 제공한다고 상상해 보세요. 한 달에 수백억 건의 사용량이 있어도 해당 수익은 몇 센트에 불과할 수 있습니다. 비용. . 정말 절망적인 패턴이라고 생각하지 않나요? 이는 당시 백연대전쟁보다 더 미친 짓이다.

AGI 시대의 스마트 단말기

APPSO: 최근에는 Huawei Cloud의 첫 번째 대규모 클라이언트측 모델 파트너가 되기도 했습니다. 이것이 향후 상용화의 방향인가요?

Liu Zhiyuan: 앞으로 2~3년 안에 더 많은 제조업체와 협력할 것입니다. 앞으로는 휴대폰이나 자동차가 아닌 AGI 시대에 속하는 스마트 단말기가 나올 것이라고 생각합니다.

APPSO: AGI 시대에 이상적인 터미널 형태는 무엇입니까?

Liu Zhiyuan: 현재의 휴대폰 형태는 실제로 당시 Apple이 도입한 멀티 터치 상호 작용 방식입니다. 하지만 미래에 AI가 충분히 똑똑해지면 클릭과 터치 상호 작용이 계속 필요할까요? 미래에는 인간의 특성에 더욱 부합하는 AGI에 속하는 자연어 상호작용 방법이 있어야 합니다. 언젠가는 뇌-컴퓨터 인터페이스가 연결되면 말을 하지 않아도 될 것이라는 얘기도 있다. 따라서 AGI에 속한 스마트 단말기는 휴대폰이 아닐 수도 있고, 휴대폰의 형태가 언젠가 바뀔 수도 있다. 가리키다.

그리고 우리가 보다 자연스럽게 상호 작용할 수 있는 방법이 있는데 왜 앱이 필요한가요 ? Apple과 같은 주요 휴대폰 제조업체가 이러한 방향으로 작업하지 않으면 다른 누군가가 분명히 그렇게 할 것입니다.

APPSO : 월페이스의 캐릭터는 어떤 캐릭터가 될 것이라고 생각하시나요?

Liu Zhiyuan: 우리 같은 스타트업 회사의 장점은 혁신, 극한의 혁신입니다. 우리의 첫 번째 목표는 AGI를 사용하는 방법을 찾는 것입니다. 우리는 이것을 하기 위해 태어났고 이것이 우리의 장점입니다.

메이저 제조사라도 혁신하지 않으면 역사의 수레바퀴에 눌려 버릴 것입니다. 당시 노키아처럼 말이죠.

APPSO: 화웨이와의 협력을 어떻게 설명하시겠습니까?

Liu Zhiyuan: 우리는 장치-클라우드 협업의 산업 모델 역할을 할 수 있는 Huawei와 같은 회사와 파트너십을 형성하기 를 희망합니다.

APPSO: 화웨이는 AI 프레임워크와 대형 모델이 매우 중요한 순혈 홍멍을 출시했습니다. 앞으로 더 많은 협력을 하시겠습니까?

Liu Zhiyuan: 스마트 칩, 스마트 운영 체제, 심지어 모델 수준에서도 분명히 협력이 있을 것입니다.

APPSO: 이러한 하드웨어 제조업체가 자체 장치측 모델을 만드는 것에 대해 걱정하시나요?

Liu Zhiyuan: 이것이 중국 시장과 미국 시장의 큰 차이점입니다. 미국의 산업 체인은 서로 강한 안정감을 갖고 있으며 모두가 함께 사업을 할 수 있습니다. 하지만 중국은 모든 기업이 스스로 모든 일을 해주기를 원하는 것 같습니다. 스스로 이루어지지 않는 부분이 있다면 매우 불안할 것입니다. 우리가 창의적으로 매우 안정적인 협력 관계를 맺을 수 있다면 그렇게 할 수 있을 것이라고 믿습니다. 모든 사람의 작업을 최대한 활용할 수 있지만 이 시장을 더 잘 점유할 수 있습니다.

APPSO: 다른 하드웨어 제조업체는 할 수 없지만 Wallface는 무엇을 할 수 있나요?

Liu Zhiyuan: 우선, 대형 모델 알고리즘의 관점에서 볼 때 실제로 그 기술은 빠르게 확산되지 않습니다. 우리는 다른 제조사가 절대 마스터하지 못하는 모델 트레이닝 기술을 추구하지 않습니다.

적어도 현재로서는 컴퓨팅 성능 및 메모리 에너지 소비의 제한으로 인해 실제로 모델 제조 프로세스에 대한 요구 사항이 더 높습니다. 보다 극단적인 방법으로 모델을 더 작은 매개변수 척도에 넣을 수 있어야 하며 동시에 더 강력한 기능을 가져야 합니다.

예를 들어, 칩 제조 공정에서는 최종 테스트 칩을 만들기 위해 가장 진보된 공정을 사용해야 합니다. 엔드 투 엔드 테스트를 위한 공간은 더 작고 에너지 소비에 더 민감하기 때문에 엔드 투 엔드 테스트 모델이라도 클라우드 모델보다 더 엄격한 상위 모델 프로세스가 필요합니다.

클라우드 테스트에서는 컴퓨팅 성능 리소스가 충분하면 더 많은 작업 공간을 확보할 수 있지만 최종 테스트에서는 칩, 메모리 및 배터리에 따라 제한됩니다. 따라서 매우 작은 모델을 훈련해야 합니다. 이러한 관점에서 볼 때, 현재 시장에 나와 있는 대형 모델 회사는 말할 것도 없고, 예를 들어 Google은 우리보다 두 달 늦게 동일한 수준의 모델을 훈련시켰고 여전히 우리보다 10% 정도 뒤쳐져 있습니다.

APPSO: 당신은 미래에 대부분의 애플리케이션이 기기 측에 있을 것이라고 예상했습니다. 이 일이 어느 정도까지 가능하다고 생각하시나요?

Liu Zhiyuan: 사실 최종 테스터는 GPT-4 또는 GPT-4o 수준이면 충분합니다. 엔드사이드 칩의 지식 밀도가 같은 비율로 증가한다면 향후 2년 내에 GPT-4 수준을 엔드사이드 테스트에 적용할 수 있을 것으로 추정됩니다. 그러면 요구 사항의 80% 이상이 완료될 것입니다. 끝 쪽.

APPSO: 당신의 예측은 꽤 급진적이네요.

Liu Zhiyuan: 급진적인가요? 우리는 기다려 볼 수 있습니다.

AGI를 향한 목표는 인간의 본성을 넘어서는 것이어야 한다

APPSO: 대형 모델이 등장한 이후 모든 대형 모델 제조업체는 TPF 기술-문제 맞춤에 대해 이야기해 왔습니다.) Wall-Facing Intelligence는 어떻게 내부적으로 기술과 제품에 대한 합의를 형성하고 T와 P를 결합합니까?

Liu Zhiyuan: 우리는 AGI 시대의 슈퍼 앱이 되고 싶습니다.

하지만 우리는 단기적으로 살아남아 우리 기술의 가치를 시장에 입증해야 합니다. 따라서 우리는 심천 중급인민법원이 인공지능 보조 재판 시스템을 출시하도록 돕는 등 일부 제조업체와의 전략적 협력을 통해 기술 검증을 완료할 것입니다. 이러한 탐색은 우리의 장기 비전을 실현하기 위한 단기 목표입니다.

APPSO: 슈퍼 애플리케이션도 매우 뜨거운 주제입니다. Baidu Robin Li는 현재 슈퍼 애플리케이션에 대해 이야기할 때 함정이거나 잘못된 제안일 수 있다고 말했습니다. 현재 슈퍼 애플리케이션이 무엇인지에 대해 일반적으로 인정되는 정의는 없습니다.

Liu Zhiyuan: 2000년 이후 나는 최소한 두 가지 매우 중요한 기술 물결을 인식했습니다. 하나는 Google과 같은 대기업을 탄생시킨 검색 기술이었습니다. 두 번째는 개인화 추천 기술이다. 이로 인해 Douyin과 같은 중요한 응용 프로그램이 탄생했습니다.

사실 당시에는 이러한 기술 자체가 매우 확실했습니다. 이것이 매우 큰 발전이라는 것은 누구나 알고 있습니다. 그것은 그것을 어떻게 사용하고 어떤 종류의 제품을 형성하는지에 관한 것입니다. 이 문제는 불확실하며 경쟁이 필요합니다.

우리에게 있어 첫째는 최첨단 기술을 익히는 것이고, 둘째는 슈퍼앱이 등장했을 때 이것이 슈퍼앱이라는 것을 인식할 수 있어야 한다는 것입니다.

APPSO: 이제 슈퍼앱을 정의하기 어렵다고 생각하시나요?

Liu Zhiyuan: 역사를 되돌아보면 Google과 Toutiao가 등장했을 때 얼마나 많은 사람들이 자신들이 슈퍼 애플리케이션이라는 것을 깨달았습니까? 당시 Yahoo News는 매일 10개의 뉴스 항목만 푸시하는 특별한 앱을 만들었습니다.

알다시피, 오늘의 헤드라인이 이미 그들 앞에 있더라도 그는 여전히 그러한 결정을 내릴 것입니다. 게다가 슈퍼앱은 아직 등장하지 않았다. 설사 등장하더라도 대부분의 사람들은 사용하지 않을 것이다.

APPSO: 슈퍼앱을 찾는 방법은 무엇입니까?

Liu Zhiyuan: 제가 학생들에게 항상 하는 말은 절대 기득권을 가진 사람이 되지 말라는 것 입니다. 이전에 여러 가지 장점이 있었다는 이유만으로 자신이 혁명을 일으켰다는 사실을 인정하기를 꺼리지 마십시오 .

많은 사람들은 자신이 혁명을 일으켰다는 사실을 인정하려고 하지 않습니다. 그는 통계적 기계 번역을 할 때 신경 기계 번역의 출현을 보고 싶지 않았습니다. 그는 신경 기계 번역을 할 때 대형 모델의 출현을 보고 싶지 않습니다. 왜냐하면 그는 자신이 잘하는 모든 일이 무의미하다고 느꼈고, 그것을 인정하고 싶지 않았기 때문이다.

APPSO: 이것이 인간의 본성입니다.

류즈위안: 사람의 99%는 인간이다. 이를 달성하려면 목표가 인간성을 넘어서야 한다는 사명감을 가져야 한다고 생각합니다 .

당신의 사명이 당신의 인간성보다 낮다면, 당신은 그것을 성취할 수 없어야 합니다. 예를 들어, 창업자가 자신에게 가장 중요한 것은 회사를 유지하는 것이라고 생각한다면 슈퍼 애플리케이션을 따라잡지 못할 확률이 높다고 생각합니다. 잘 해?

APPSO: 다소 이상주의적인 사람만이 그런 말을 할 겁니다.

Liu Zhiyuan: 이상주의가 없었다면 저는 이 회사를 설립하지 못했을 것입니다.

APPSO: 어떤 사람들은 대형 모델에서 지능형 에이전트로의 난이도가 기하급수적이라고 말합니다. 이것이 사실인가요?

Liu Zhiyuan: 지능 자체에 대한 표준적인 답은 없다고 생각합니다. 하지만 핵심은 지능에 무엇을 넣느냐에 달려 있습니다. 내가 더 낙관하는 점은 지능형 에이전트가 계획, 의사결정, 탐색 능력 등 많은 것을 갖출 수 있다는 점이다. 이 모든 것을 AGI의 일부로 본다면 사실 앞으로 더 기대해볼 만한 것은 인터넷 에이전트라고 생각합니다.

이는 이러한 에이전트로 구성된 인터넷과 동일합니다. 우리는 이를 지능 인터넷이라고 부릅니다. 더욱 기대해볼 가치가 있는 것 같아요. 우리 인간 사회와 마찬가지로 이 사회도 고도로 상호 연결된 공동체라고 상상할 수 있습니다. 모두가 완전한 협력을 통해 일부 작업을 완료합니다. 많은 분야, 특히 복잡한 분야에서는 실제로 모든 사람이 자신의 전문적 배경과 전문 지식을 가질 것을 요구하며 이를 완성하기 위해 함께 노력해야 합니다.

APPSO: 지금 AGI에 관해 이야기하기엔 좀 너무 먼 이야기인가요?

류즈위안: 멀지 않은 것 같아요. ChatGPT가 2022년 말쯤 나오기 전까지 저는 AGI에 아직도 해결되지 않은 문제, 즉 상식의 문제, 즉 세상에 대한 상식을 어떻게 확립하느냐 하는 문제가 있다는 것을 항상 느꼈습니다.

예를 들어 오리는 머리가 하나, 발이 두 개, 날개가 두 개라는 기본적인 상식이 있습니다. GPT-3.5가 등장하기 전에는 이런 지식을 데이터에서 배우기 어렵다고 생각했습니다. 테이블에서 바닥으로 컵을 쓸 때 일어나는 현상 등 신체적인 문제도 포함됩니다. 대형 모델에 대한 상식적인 질문을 하면 그는 대답할 수 없습니다.

ChatGPT가 등장한 이후 우리는 이러한 상식이 데이터 기반 방식으로 모델을 통해 학습될 수 있는 것으로 나타났습니다. 단지 이전에 호출하는 방법을 몰랐을 뿐인데 ChatGPT가 호출하는 방법을 알려주었습니다. 나는 이 기술적 경로가 매우 원활하다고 생각한다. 학습해야 할 지식에 해당하는 데이터를 이 모델에 넘겨주기만 하면 됩니다.

APPSO: 대형 모델이 정말로 인간처럼 세상을 이해할 수 있을까요?

Liu Zhiyuan: 이 모델에 연결되어 이러한 앱을 사용하는 일상적인 습관을 학습합니다. 사용자의 선호도를 학습하지 못할 이유가 전혀 없습니다. 예를 들어, 내가 비행기를 예약하고 싶을 때 내가 예약하고 싶을 때 그에게 말하면 그는 그냥 예약해 줄 것입니다.
그래서 제 생각에는 이 기술의 방향이 매우 정해져 있는 것 같아요. 데이터, 아키텍처, 성장 방식의 3가지 요소를 어떻게 해결할 것인가에 대해서만 이야기한다면, 이 문제를 좀 더 낙관적으로 보아야 한다고 생각합니다.

OpenAI는 6년 안에 초지능 기업이 될 것이라고 하는데, 이는 매우 실현 가능한 목표라고 생각합니다 .

# Aifaner: Aifaner(WeChat ID: ifanr)의 공식 WeChat 공개 계정을 팔로우하신 것을 환영합니다. 더 흥미로운 콘텐츠가 최대한 빨리 제공될 예정입니다.

Ai Faner | 원본 링크 · 댓글 보기 · Sina Weibo


게시됨

카테고리

작성자

태그: