Apple은 인공 지능 시스템을 교육하기 위해 소셜 미디어에서 저작권이 있는 콘텐츠를 스크랩한 적발된 업계만큼이나 오래된 생성적 AI 개발자 중 최신입니다.
Proof News의 새로운 보고서 에 따르면 Apple은 AI 훈련을 위해 173,536개의 YouTube 동영상 자막이 포함된 데이터 세트를 사용해 왔습니다. 그러나 허가 없이 그러한 데이터를 활용하는 것을 금지하는 YouTube의 특정 규칙에도 불구하고 이러한 위반이 Apple만 있는 것은 아닙니다. Anthropic , Nvidia 및 Salesforce를 포함한 다른 AI 거물급 기업도 이를 사용하여 적발되었습니다.
YouTube 자막으로 알려진 데이터 세트에는 Khan Academy, MIT, Harvard에서 The Wall Street Journal, NPR 및 BBC에 이르기까지 48,000개가 넘는 YouTube 채널의 비디오 대본이 포함되어 있습니다. 'The Late Show With Stephen Colbert', 'Last Week Tonight with John Oliver', 'Jimmy Kimmel Live'와 같은 심야 버라이어티 쇼의 대본도 YouTube 자막 데이터베이스의 일부입니다. Marques Brownlee, MrBeast 등 YouTube 인플루언서와 수많은 음모론자들의 동영상도 허가 없이 삭제되었습니다.
스타트업 EleutherAI가 편집한 데이터 세트 자체에는 비디오 파일이 포함되어 있지 않지만 일본어, 독일어, 아랍어를 포함한 다른 언어로의 번역이 많이 포함되어 있습니다. EleutherAI는 YouTube뿐만 아니라 유럽 의회 기록 및 Wikipedia에서 데이터를 가져온 비영리 단체가 직접 만든 Pile이라는 더 큰 데이터 세트에서 데이터를 얻은 것으로 알려졌습니다 .
Bloomberg , Anthropic 및 Databricks 도 Pile에 대한 모델을 훈련했다고 해당 회사의 관련 간행물에 나와 있습니다. Anthropic의 대변인 Jennifer Martinez는 Proof News에 보낸 성명에서 “The Pile에는 YouTube 자막의 아주 작은 부분이 포함되어 있습니다.”라고 말했습니다. “YouTube의 약관은 The Pile 데이터 세트의 사용과 구별되는 플랫폼의 직접적인 사용을 다루고 있습니다. YouTube 서비스 약관 위반 가능성이 있는 점에 대해서는 The Pile 작성자에게 안내해 드려야 할 것 같습니다.”
기술적인 측면을 떠나, AI 스타트업이 오픈 인터넷의 콘텐츠를 스스로 돕는 것은 ChatGPT가 데뷔한 이후로 이슈가 되었습니다. Stability AI와 Midjourney는 현재 저작권이 있는 저작물을 허가 없이 스크랩했다는 주장으로 콘텐츠 제작자로부터 소송을 받고 있습니다. YouTube를 운영하는 Google 자체는 지난 7월 에 이어 9월에도 집단 소송을 당했습니다 . 회사는 이 소송이 "Google의 서비스뿐만 아니라 생성 AI라는 아이디어 자체에 큰 타격을 줄 것"이라고 주장합니다.
나: 소라를 훈련시키는데 어떤 데이터가 사용됐나요? 유튜브 영상?
OpenAI CTO: 사실 잘 모르겠습니다…(Murati가 Sora에 대한 많은 가장 큰 질문에 답한 전체 @WSJ 인터뷰를 시청하시기 바랍니다. 아이러니하게도 YouTube에서 전체 인터뷰:… pic.twitter.com/51O8Wyt53c
— 조안나 스턴(@JoannaStern) 2024년 3월 14일
그리고 지난 7월, 마이크로소프트 AI CEO 무스타파 술레이만(Mustafa Suleyman)은 천상의 “사회적 계약”은 웹에서 발견되는 모든 것이 공정한 게임임을 의미한다고 주장했습니다.
Suleyman은 CNBC 에 “이미 공개 웹에 있는 콘텐츠와 관련하여 90년대 이후 해당 콘텐츠의 사회적 계약은 공정 사용이라는 것이었습니다.”라고 말했습니다. “누구나 그것을 복사하고, 다시 만들고, 재현할 수 있습니다. 그것은 프리웨어였습니다. 원하신다면 그렇게 이해해 주세요.”