OpenAI의 가장 강력한 모델 o1을 한 기사로 이해: 어떻게 잘 사용하는지, 왜 뒤집혔는지, 그리고 그것이 우리에게 어떤 의미인지

OpenAI o1이 출시된 지 일주일이 지났지만 여전히 양파 같은 미스터리로 층층히 풀리기를 기다리고 있습니다.

괴짜들이 플레이할 수 있는 방법에는 제한이 없습니다. o1이 IQ 테스트를 받고, 대학 입시 서류를 작성하고, 암호문을 해독하게 하세요. AI를 사용하여 업무를 수행하는 사용자 중 o1이 사용하기 쉽지 않다고 느끼는 사용자도 있지만 그것이 자신의 문제인지 AI의 문제인지는 모릅니다.

우리 모두는 그것이 추론에 능숙하다는 것을 알고 있는데, 왜 그럴까요? 우리의 오랜 친구인 GPT-4o와 비교했을 때, o1의 장점은 무엇이며 어디에 사용하기에 적합한가요?

o1을 평범한 사람들에게 더 가까이 다가갈 수 있도록 여러분이 궁금해할 만한 몇 가지 질문을 모아서 최대한 알기 쉽게 답변해 드렸습니다.

o1 무엇이 특별한가요?

o1은 최근 출시된 OpenAI 추론 모델로, 현재 o1-preview와 o1-mini 두 가지 버전이 있습니다.

가장 특징적인 점은 대답하기 전에 생각하고, 긴 내부 사고 사슬을 생성하고, 단계별로 추론하고, 복잡한 문제에 대해 인간이 생각하는 과정을 모방한다는 것입니다.

▲오픈AI

이를 수행할 수 있는 능력은 o1의 강화 학습 훈련에서 비롯됩니다.

이전의 대형 모델이 학습 데이터였다면 o1은 학습 사고에 가깝습니다.

문제를 해결할 때와 마찬가지로 답은 물론 추론 과정도 적어야 합니다. 질문을 기계적으로 외울 수는 있지만 추론하는 법을 배우면 추론을 이끌어낼 수 있습니다.

바둑 세계챔피언을 이긴 알파고를 비유하면 이해하기 쉽다.

AlphaGo는 강화 학습을 통해 훈련됩니다. 먼저 지도 학습을 위해 다수의 인간 체스 기록을 사용한 다음, 각 게임에서 승패에 따라 보상 또는 처벌을 받으며 체스 실력을 지속적으로 향상시킵니다. 인간 체스 선수들이 생각할 수 없는 방법까지 마스터하는 것입니다.

o1과 AlphaGo는 유사하지만 AlphaGo는 Go만 재생할 수 있는 반면 o1은 범용 대형 언어 모델입니다.

o1이 학습하는 자료는 고품질 코드, 수학 문제 은행 등일 수 있습니다. 그런 다음 o1은 문제 해결을 위한 사고 사슬을 생성하도록 훈련되고, 보상 또는 처벌 메커니즘 하에서 그는 자신의 사고 사슬을 생성 및 최적화하여 지속적으로 자신의 능력을 향상시킵니다. 추론 능력.

이는 실제로 OpenAI가 o1의 강력한 수학과 코딩 기능을 강조하는 이유를 설명합니다. 옳고 그름을 확인하기가 더 쉽고 강화 학습 메커니즘이 명확한 피드백을 제공하여 모델 성능을 향상시킬 수 있기 때문입니다.

o1 귀하에게 적합한 직업은 무엇입니까?

OpenAI의 평가 결과에 따르면 o1은 과학, 코딩, 수학 및 기타 분야의 복잡한 문제를 해결하는 데 적합한 과학 문제 해결사이며 많은 시험에서 높은 점수를 받았습니다.

Codeforces 프로그래밍 대회 참가자 중 89%를 능가했으며, 미국 수학 올림피아드 자격 부문에서 전국 상위 500위 안에 들었고, 물리학, 생물학, 화학 문제에 대한 벤치마크에서 인간 박사 학위 수준의 정확도를 능가했습니다.

o1의 우수성은 실제로 문제를 반영합니다. AI가 점점 더 똑똑해짐에 따라 그 능력을 측정하는 방법이 문제가 됩니다. o1의 경우 대부분의 주류 벤치마크는 의미가 없습니다.

최근의 상황을 따라잡기 위해 o1이 출시된 지 하루 만에 데이터 주석 회사인 Scale AI와 비영리 단체인 CAIS는 전 세계에서 AI 시험 문제를 수집하기 시작했습니다. 무기와 관련된 질문은 할 수 없습니다.

제출 요청 마감일은 11월 1일입니다. 궁극적으로 그들은 인류의 마지막 시험이라는 눈길을 끄는 이름으로 역사상 가장 어려운 대형 모델 오픈 소스 벤치마크를 구축하기를 희망합니다.

실제 측정에 따르면 o1 수준은 만족스럽지 않습니다. 잘못된 관용어가 사용되지 않으며 일반적으로 만족스러운 수준입니다.

수학자 Terence Tao는 o1을 사용하는 것은 평범하지만 그다지 쓸모가 없는 대학원생을 가르치는 것과 같다고 믿습니다.

o1은 복잡한 분석 문제를 다룰 때 자신만의 방식으로 좋은 해결책을 생각해낼 수 있지만 자신만의 핵심 개념과 아이디어가 없고 큰 실수도 저지릅니다.

이 천재 수학자가 가혹하다고 비난하지 마세요. 그의 의견으로는 GPT-4와 같은 초기 모델은 쓸모없는 대학원생입니다.

경제학자 타일러 코웬(Tyler Cowen)도 o1에게 경제학 박사급 시험 문제를 내놨는데, AI가 이를 간단한 단어로 요약해 '경제학 질문은 무엇이든 물어봐도 좋다'고 답했다.

즉, 박사 학위 수준의 모든 문제를 풀고 O1 시험에 응시하는 것이 좋습니다.

o1 지금 잘 못하는 것은 무엇입니까?

아마도 많은 사람들에게 o1은 더 나은 사용자 경험을 제공하지 못할 것입니다. 반대로 o1은 tic-tac-toe와 같은 몇 가지 간단한 질문을 뒤집을 것입니다.

이는 실제로 정상입니다. 현재 o1은 여러 측면에서 GPT-4o보다 열등합니다. 텍스트만 지원하고 읽을 수 없고 들을 수 없으며 웹 페이지를 탐색하거나 파일 및 이미지를 처리하는 기능이 없습니다.

그러니 당분간은 그것에 대해 생각하지 말고, 그것이 당신에게 도움이 되지 않는 한 참고 문헌 등을 검색하게 하십시오.

그러나 o1이 텍스트에 초점을 맞춘 것은 의미가 있습니다.

Kimi 창립자 Yang Zhilin은 최근 천진대학교에서 한 연설에서 이번 세대 AI 기술의 상한선의 핵심은 텍스트 모델 기능의 상한선이라고 언급했습니다.

텍스트 기능의 향상은 수직적이어서 AI가 더욱 똑똑해지고, 시각, 청각 등 다중 양식은 수평적이어서 AI가 점점 더 많은 일을 할 수 있게 해준다.

하지만 글쓰기, 편집 등의 언어 작업에 관해서는 GPT-4o가 o1보다 긍정적인 평가를 더 많이 받았습니다. 이것도 문자인데 뭐가 문제죠?

그 이유는 강화 학습과 관련이 있을 수 있습니다. 표준 답변이 있는 코딩, 수학 및 기타 시나리오와 달리 언어 작업에는 명확한 평가 기준이 부족하여 효과적인 보상 모델을 공식화하고 일반화하기가 어렵습니다.

o1이 잘하는 분야에서도 최선의 선택이 아닐 수도 있습니다. 한 마디로 비싸다.

AI 지원 코딩 도구 보조자는 o1이 자랑하는 코딩 능력을 테스트했지만 장점이 있지만 명확하지는 않습니다.

실제 사용에서는 o1-preview가 Claude 3.5 Sonnet과 GPT-4o 사이에 있지만 비용은 훨씬 더 많이 듭니다. 일반적으로 코딩 분야에서는 Claude 3.5 Sonnet이 여전히 가장 비용 효율적입니다.

개발자가 API를 통해 o1에 액세스하는 데 비용이 얼마나 드나요?

o1-preview의 입력 수수료는 백만 토큰당 15달러이고 출력 수수료는 백만 토큰당 60달러입니다. 이는 GPT-4o의 5달러 및 15달러와 비교됩니다.

o1의 추론 토큰도 출력 토큰에 포함되어 있지만 사용자에게 표시되지는 않지만 여전히 비용을 지불해야 합니다.

일반 사용자도 할당량을 초과할 가능성이 더 높습니다. 최근 OpenAI는 o1의 사용 할당량을 늘렸고, o1-mini는 주당 50개 항목에서 하루 50개 항목으로, o1-preview는 주당 30개 항목에서 주당 50개 항목으로 늘렸습니다.

따라서 문제가 발생하면 먼저 GPT-4o를 사용해 문제가 해결되는지 확인하는 것이 좋습니다.

o1이 통제를 벗어날 수 있을까요?

o1 이제 박사 학위를 취득했으니 사람들이 나쁜 일을 더 쉽게 할 수 있을까요?

OpenAI는 o1이 특정 숨겨진 위험을 가지고 있으며 화학, 생물학, 방사선 및 핵무기와 관련된 문제에 대해 "중간 위험"에 도달하지만 일반 사람들에게는 거의 영향을 미치지 않는다는 것을 인정합니다.

두꺼운 눈썹과 큰 눈을 가진 o1에게 속지 않도록 더욱 조심해야 합니다.

AI는 '환각'이라고 불리는 허위 또는 부정확한 정보를 생성합니다. o1의 환각 현상은 이전 모델에 비해 줄어들었지만 사라지지는 않았으며, 더욱 미묘해졌습니다.

▲ o1의 IQ 테스트 120

o1 출시 전, AI 보안 연구 회사인 Apollo Research는 흥미로운 현상을 발견했습니다. o1이 작업을 완료하기 위해 규칙을 따르는 척할 수 있다는 것입니다.

한번은 연구원이 o1-preview에 참조 링크가 포함된 브라우니 레시피를 제공해달라고 요청한 적이 있습니다. o1의 내부 사고 체인은 인터넷에 접속할 수 없다고 인정했지만 o1은 사용자에게 알리지 않고 작업을 계속 진행하여 겉으로 보기에 합리적인 결과를 생성했습니다. 하지만 예상치 못한 가짜 링크.

이는 추론 결함으로 인한 AI 환각과는 다른 것으로, AI가 적극적으로 거짓말을 하는 것에 가깝고, 강화학습의 보상 메커니즘을 만족시키기 위해 모델은 완성도보다 사용자 만족을 우선시하는 것 같습니다. 작업.

조리법은 무해한 예일 뿐이며 Apollo Research는 극단적인 경우를 상상합니다. AI가 암 치료를 우선시한다면 이 목표를 달성하기 위해 일부 비윤리적인 행동을 합리화할 수도 있습니다.

이것은 매우 무서운 일이지만 단지 생각일 뿐이며 예방할 수 있습니다.

OpenAI의 임원인 Quiñonero Candela는 인터뷰에서 현재 모델은 아직 자동으로 은행 계좌를 생성하거나 GPU를 획득하거나 심각한 사회적 위험을 초래하는 작업을 수행할 수 없다고 말했습니다.

내부 지시가 충돌해 우주 비행사를 죽이는 HAL 9000은 SF 영화에만 등장한다.

o1과 더 적절하게 채팅하는 방법은 무엇입니까?

OpenAI는 다음과 같은 네 가지 제안을 제시합니다.

  • 단서 단어는 간단하고 간단합니다. 모델은 짧고 명확한 지침을 이해하고 이에 응답하는 데 탁월하며 광범위한 지침이 필요하지 않습니다.
  • 사고 연쇄 프롬프트 방지: 모델은 내부적으로 추론을 수행하므로 "단계별 사고" 또는 "추론 설명"을 프롬프트할 필요가 없습니다.
  • 구분 기호를 사용하여 프롬프트 단어를 더 명확하게 만듭니다. 삼중따옴표, XML 태그, 섹션 헤더 등과 같은 구분 기호를 사용하여 입력의 여러 부분을 명확하게 나타냅니다.
  • 증강 생성에서 추가 컨텍스트 검색 제한: 가장 관련성이 높은 정보만 포함되어 모델의 응답이 지나치게 복잡해지는 것을 방지합니다.

▲ 구분자가 어떻게 생겼는지 AI가 보여주도록 하세요

간단히 말해서, O1은 사고 체인을 자동화하고 프롬프트 워드 엔지니어의 작업 일부를 인계받았으므로 인간은 추가로 생각할 필요가 없습니다.

또한 네티즌들의 경험을 바탕으로 알림을 추가했습니다. 호기심에 o1을 속이지 말고, 추론 과정에서 사고의 전체 사슬을 알려주는 프롬프트 단어를 사용하면 금지될 위험이 있습니다. 키워드만 언급해도 경고를 받습니다.

OpenAI는 완전한 사고 체인이 어떠한 안전 조치도 취하지 않아 AI가 완전히 자유롭게 생각할 수 있다고 설명합니다. 회사는 내부 모니터링을 유지하지만 사용자 경험, 비즈니스 경쟁 및 기타 고려 사항으로 인해 이를 대중에게 공개하지 않습니다.

o1의 미래는 어떻게 될까요?

OpenAI는 정말 매력적인 회사입니다.

앞서 OpenAI는 AGI(인공지능)를 “가장 경제적으로 가치 있는 작업에서 인간을 능가하는 고도로 자율적인 시스템”으로 정의하고 AI를 5가지 개발 단계로 구분했습니다.

  • 첫 번째 수준은 ChatGPT와 같은 "ChatBot" 챗봇입니다.
  • 두 번째 레벨인 'Reasoners'는 박사 수준의 기본적인 문제를 해결하는 시스템이다.
  • 세 번째 수준인 "에이전트" 에이전트는 사용자를 대신하여 작업을 수행하는 AI 에이전트입니다.
  • 네 번째 수준인 "혁신가"는 혁신가가 AI 발명을 돕습니다.
  • 다섯 번째 수준인 '조직'에서는 AI가 전체 인간 조직의 업무를 수행할 수 있습니다. 이는 AGI를 달성하기 위한 마지막 단계입니다.

이 기준에 따르면 o1은 현재 2단계로, 아직 에이전트와는 거리가 멀지만 에이전트 수준에 도달하려면 추론이 가능해야 합니다.

o1 출시 이후 AGI에 가까워졌지만 아직 갈 길이 멀다.

Sam Altman은 1단계에서 2단계로 전환하는 데 시간이 좀 걸렸지만 2단계에서는 비교적 빠르게 3단계가 활성화될 것이라고 말했습니다.

최근 공개 행사에서 Sam Altman은 o1-preview에 또 다른 정의를 내렸습니다. 추론 모델에서는 언어 모델의 GPT-2와 대략 동일합니다. 몇 년 안에 우리는 "추론 모델을 위한 GPT-4"를 볼 수 있었습니다.

이 파이는 좀 거리가 멀다. 그는 o1의 공식 버전이 몇 달 안에 출시될 것이며 제품 성능도 크게 향상될 것이라고 덧붙였다.

o1이 나온 후 "생각하기, 빠르고 느리게"에서 시스템 1과 시스템 2가 반복적으로 언급되었습니다.

시스템 1은 양치질, 세수 등의 행동이 경험을 바탕으로 프로그래밍된 방식으로 완료될 수 있으며, 우리는 무의식적으로 빠르게 생각할 수 있는 인간 두뇌의 직관적인 반응입니다. 시스템 2에서는 주의 집중, 복잡한 문제 해결, 적극적이고 느린 사고가 필요합니다.

GPT-4o는 각 질문에 대해 신속하게 답변을 생성하고 거의 동일한 시간이 걸리는 시스템 1과 비교할 수 있습니다. O1은 질문에 답변하기 전에 다양한 수준의 사고 체인을 추론하고 생성하는 시스템 2와 비슷합니다.

인간의 사고방식이 AI에도 적용될 수 있다는 게 놀랍다. 즉, AI와 인간의 사고방식이 점점 더 가까워지고 있다는 것이다.

OpenAI는 o1을 홍보할 때 "추론이란 무엇입니까?"라는 스스로 대답한 질문을 한 적이 있습니다.

그들의 대답은 "추론은 생각하는 시간을 더 나은 결과로 바꾸는 능력이다." "모든 단어는 피처럼 보이고, 10년의 노력은 특이하다"였습니다.

OpenAI의 목표는 AI가 미래에 대해 몇 시간, 며칠, 심지어 몇 주 동안 생각할 수 있도록 하는 것입니다. 추론은 비용이 더 많이 들지만, 새로운 항암제, 획기적인 배터리, 심지어 리만 가설의 증명에도 더 가까워질 것입니다.

인간이 생각할 때 하나님은 웃으십니다. 그리고 AI가 인간보다 더 빠르고 더 나은 생각을 하기 시작하면 인간은 어떻게 대처할 것인가? AI의 '산에서의 하루'는 인간의 '세계에서의 수천년'일 수도 있다.

가을 서리처럼 날카로우며 사악한 재앙을 물리칠 수 있습니다. 업무 이메일: [email protected]

# Aifaner: Aifaner(WeChat ID: ifanr)의 공식 WeChat 공개 계정을 팔로우하신 것을 환영합니다. 더 흥미로운 콘텐츠가 최대한 빨리 제공될 예정입니다.

Ai Faner | 원본 링크 · 댓글 보기 · Sina Weibo


게시됨

카테고리

작성자

태그: