
당신뿐만이 아닙니다. 검색 결과가 점점 더 나빠지고 있습니다. Amazon Web Services(AWS) 연구원은 오늘날 인터넷 콘텐츠의 57%가 AI에서 생성되었거나 AI 알고리즘을 사용하여 번역된 것임을 시사 하는 연구를 수행했습니다 .
" A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way Parallelism "이라는 제목의 이 연구에서는 주어진 콘텐츠를 가져와서 여러 언어로 역류시키는 저비용의 기계 번역(MT)이 최고의 기술이라고 주장합니다. 주범. “기계 생성 다방향 병렬 번역은 MT가 가능한 저자원 언어로 웹에서 번역된 콘텐츠의 총량을 지배할 뿐만 아니라; 이는 또한 해당 언어로 된 전체 웹 콘텐츠의 상당 부분을 차지합니다.”라고 연구원들은 연구에서 썼습니다.
그들은 또한 단일 언어로 게시된 콘텐츠와 비교하여 어떤 콘텐츠가 여러 언어로 기계 번역되는지에서 선택 편향의 증거를 발견했습니다. 연구원들은 “이 콘텐츠는 단일 언어로 번역된 콘텐츠에 비해 더 짧고 예측 가능하며 주제 분포가 다릅니다.”라고 썼습니다.
더욱이 인터넷에서 AI 생성 콘텐츠의 양이 증가하고 해당 콘텐츠를 편집하고 조작하는 AI 도구에 대한 의존도가 높아지면서 모델 붕괴라는 현상이 발생할 수 있으며 이미 웹 전체에서 검색 결과의 품질이 저하되고 있습니다. ChatGPT , Gemini 및 Claude 와 같은 최첨단 AI 모델은 공개 웹을 스크랩하고(저작권 위반 여부에 관계없이) 공개 웹을 AI 생성으로 가득 채우는 방식으로만 얻을 수 있는 엄청난 양의 교육 데이터에 의존한다는 점을 감안할 때 부정확한 경우가 많으므로 콘텐츠의 성능이 심각하게 저하될 수 있습니다.
옥스퍼드 대학의 Ilia Shumailov 박사는 Windows Central에 “모델 붕괴가 얼마나 빨리 시작되고 얼마나 파악하기 어려운지 놀랍습니다.”라고 말했습니다. “처음에는 소수 데이터, 즉 제대로 표현되지 않은 데이터에 영향을 미칩니다. 그런 다음 출력의 다양성에 영향을 미치고 분산이 줄어듭니다. 때로는 소수 데이터의 성능 저하를 숨길 수 있는 다수 데이터의 작은 개선이 관찰되는 경우도 있습니다. 모델 붕괴는 심각한 결과를 초래할 수 있습니다.”
연구자들은 전문 언어학자들이 20개 범주 중 하나에서 무작위로 선택된 10,000개의 영어 문장을 분류하도록 하여 이러한 결과를 입증했습니다. 연구원들은 "2방향 병렬 데이터와 8방향 이상의 병렬 데이터(예: 언어 번역 수)를 비교할 때 주제 분포의 극적인 변화를 관찰했으며, '대화 및 의견' 주제는 게시된 데이터의 22.5%에서 40.1%로 증가했습니다." .
이는 여러 언어로 번역되는 데이터 유형의 선택 편향을 가리키며, 이는 "대화 및 의견" 주제에서 나올 가능성이 "상당히 더 높습니다".
또한 연구원들은 "다방향 병렬 번역은 양방향 병렬 번역보다 품질이 훨씬 낮다(6.2 Comet 품질 추정 포인트 더 나쁨)"는 사실을 발견했습니다. 연구원들이 고도로 다방향 병렬 문장(8개 이상의 언어로 번역됨) 중 100개를 감사한 결과, "대다수"가 "품질이 낮고 전문 지식이 거의 또는 전혀 필요하지 않은 것으로 특징지어진" 기사가 포함된 콘텐츠 팜에서 나온 것임을 발견했습니다. , 또는 창조를 위한 사전 노력.”
이는 OpenAI의 CEO인 Sam Altman이 저작권이 있는 저작물에 대한 무료 액세스 없이 ChatGPT와 같은 도구를 만드는 것이 얼마나 "불가능" 한지에 대해 계속 열중하고 있는지 설명하는 데 확실히 도움이 됩니다.
