
ChatGPT, Gemini 및 Claude 와 같은 오늘날의 챗봇을 지원하는 대규모 언어 모델은 엄청나게 강력한 생성 AI 시스템이며 부팅하기에 엄청나게 전력을 소모하는 시스템입니다.
캘리포니아 대학교 산타크루즈(Santa Cruz)의 최근 연구 에 따르면 수십억 개의 매개변수를 실행하는 최신 LLM이 성능 손실 없이 단 13와트의 전력 으로 작동할 수 있는 것으로 나타났습니다. 이는 대략 100W 전구의 전력 소모량이며 Nvidia H100 GPU가 소비하는 700W에 비해 50배 향상된 성능 입니다.
논문의 수석 저자인 Jason Esraghian은 "우리는 훨씬 더 적은 비용으로 동일한 성능을 얻었습니다. 우리가 해야 할 일은 신경망 작동 방식을 근본적으로 바꾸는 것뿐이었습니다."라고 말했습니다. "그런 다음 우리는 한 단계 더 나아가 맞춤형 하드웨어를 구축했습니다." 그들은 신경망의 곱셈 행렬을 없애서 그렇게 했습니다.
행렬 곱셈은 오늘날 LLM을 지원하는 알고리즘의 초석입니다. 단어는 숫자로 표현된 다음 특정 단어의 중요성과 문장이나 단락의 다른 단어와의 관계에 따라 언어 출력을 생성하기 위해 서로 가중치를 부여하고 곱하는 행렬로 구성됩니다.
이러한 행렬은 물리적으로 분리된 수백 개의 GPU에 저장되며 각각의 새로운 쿼리 또는 작업과 함께 가져옵니다. 다수의 행렬 사이에 곱해야 하는 데이터를 이동하는 프로세스에는 상당한 양의 전력이 필요하므로 비용이 발생합니다.
이 문제를 해결하기 위해 UC Santa Cruz 팀은 행렬 내의 숫자를 삼항 상태로 강제했습니다. 즉, 모든 단일 숫자는 음수 1, 0 또는 양수 1의 값을 전달했습니다. 이를 통해 프로세서는 숫자를 곱하는 대신 단순히 숫자를 합산할 수 있습니다. 이는 알고리즘에 아무런 차이가 없지만 하드웨어 측면에서 엄청난 비용을 절약하는 조정입니다. 작업 횟수 감소에도 불구하고 성능을 유지하기 위해 팀은 시스템에 시간 기반 계산을 도입하여 네트워크에 대한 "메모리"를 효과적으로 생성하고 줄어든 작업을 처리할 수 있는 속도를 높였습니다.
“회로 설계자의 관점에서 보면 엄청난 비용을 수반하는 곱셈의 오버헤드가 필요하지 않습니다.”라고 Esraghian은 말했습니다. 그리고 팀은 맞춤형 FGPA 하드웨어에 새로운 네트워크를 구현했지만, 오픈 소스 소프트웨어와 사소한 하드웨어 조정을 사용하여 효율성 향상의 상당 부분을 기존 모델에 개조할 수 있다고 확신하고 있습니다. 표준 GPU에서도 팀은 메모리 소비가 10배 감소하는 동시에 작동 속도가 25% 향상되는 것을 확인했습니다.
Nvidia 및 AMD와 같은 칩 제조업체가 GPU 프로세서 성능의 한계를 지속적으로 확장함에 따라 이러한 시스템을 수용하는 데이터 센터에 대한 전기 수요(및 관련 금융 비용)가 최근 몇 년간 급증했습니다. 컴퓨팅 성능이 향상됨에 따라 칩에서 생성되는 폐열의 양도 그에 비례하여 증가합니다. 이제 이 폐열을 완전히 소멸하려면 자원 집약적인 액체 냉각 시스템이 필요합니다.
Arm CEO 르네 하스(Rene Haas)는 지난 4월 The Register에 시정 조치를 취하지 않으면 AI 데이터 센터가 10년 안에 미국 전체 전기 생산량의 최대 20~25%를 빠르게 소비할 수 있다고 경고했습니다 .
