
OpenAI는 크라우드 소싱 트레이너가 GPT-4 모델을 더욱 개선할 수 있도록 돕기 위해 CriticGPT 라는 AI 도우미를 개발 했습니다. 인간이 놓칠 수 있는 미묘한 코딩 오류를 찾아냅니다.
GPT-4와 같은 대규모 언어 모델은 처음 훈련된 후 인간 피드백을 통한 강화 학습 (RLHF)으로 알려진 지속적인 개선 프로세스를 거칩니다. 인간 트레이너는 시스템과 상호 작용하고 다양한 질문에 대한 응답에 주석을 달고 다양한 응답을 서로 평가하므로 시스템은 선호하는 응답을 반환하는 방법을 학습하고 모델의 응답 정확도를 높입니다.
문제는 시스템의 성능이 향상될수록 트레이너의 전문성 수준을 넘어설 수 있고, 실수와 오류를 식별하는 프로세스가 점점 더 어려워진다는 것입니다.
이 AI 트레이너가 항상 주제 전문가는 아닙니다. 작년에 OpenAI는 모델 성능을 향상시키기 위해 케냐 근로자들에게 크라우드소싱을 제공하고 시간당 2달러 미만의 급여를 지급하는 것을 포착했습니다 .

이 문제는 CriticGPT가 필요한 시스템의 코드 생성 기능을 개선할 때 특히 어렵습니다.
“우리는 ChatGPT의 코드 출력에서 오류를 포착하기 위해 CriticGPT라고 불리는 GPT-4 기반 모델을 훈련했습니다.”라고 회사는 목요일 블로그 게시물 에서 설명했습니다. "우리는 사람들이 ChatGPT 코드를 검토하기 위해 CriticGPT의 도움을 받을 때 도움을 받지 않은 사람들보다 60% 더 나은 성과를 낸다는 사실을 발견했습니다."
게다가 이 회사는 " LLM 비평가가 LLM 버그를 잡는 데 도움이 됩니다 "라는 제목의 백서를 발표했습니다. 이 백서는 "LLM은 자격을 갖춘 사람이 코드 검토 비용을 지불한 것보다 훨씬 더 많은 삽입된 버그를 포착하고 더 나아가 사람의 비평보다 모델 비평을 선호한다는 사실을 발견했습니다. 80% 이상이요.”
흥미롭게도 이 연구에서는 인간이 CriticGPT와 협력했을 때 AI의 환각 반응 비율이 CriticGPT가 혼자 작업을 수행했을 때보다 낮았지만, 환각 비율은 인간이 스스로 작업을 수행한 경우보다 여전히 높았다는 사실도 발견했습니다.
