모든 면에서 소라를 능가하는 메타의 최신 AI 영상 모델의 강점은 무엇일까?

지난 이틀간 메타무비젠 출시로 인해 영상세대 모델 분야가 다시 폭발적으로 성장했습니다.

업계 안팎에서 가장 안타까운 점은 두 가지에 불과하다. 첫째, 생성 효과가 자연스럽고 생생하며, 그림과 일치하는 사운드를 동시에 생성할 수 있다는 점이다. 당시 Sora 출시; 둘째, Meta AI의 새로운 모델은 자동으로 정의 가능하며 비디오 화면 비율과 비디오 요소 및 세부 사항을 모두 사용자의 요구에 따라 조정할 수 있습니다.

그렇다면 영상 세대의 새로운 혁명을 주도할 메타무비젠의 구체적인 내용은 무엇일까? 공식 웹사이트와 데모 비디오에서 이러한 놀라운 효과를 어떻게 얻을 수 있습니까? Meta AI의 비디오 모델 책임자인 Andrew Brown은 Meta Movie Gen의 이론적 기술을 구체적으로 설명했습니다.

  • Movie Gen은 전반적인 품질과 일관성 측면에서 Sora보다 훨씬 낫습니다. 진정성과 아름다움 테스트의 사진 현실성, 그리고 Movie Gen이 전반적으로 승리했습니다.
  • Meta Movie Gen은 텍스트-비디오 생성, 텍스트-이미지 생성, 개인화, 편집 및 비디오-오디오 생성을 수행할 수 있는 모델 세트입니다.
  • 데이터, 계산 및 모델 매개변수를 확장하고 이를 흐름 일치와 결합하고 간단한 공통 LLM 아키텍처(Llama)로 이동하여 SOTA 비디오 생성 품질을 달성하는 것이 중요합니다.
  • 우리(Meta AI)는 미디어 생성을 위해 Llama 아치를 처음으로 사용했습니다.
  • Movie Gen은 최대 지속 시간이 16초(16fps)인 다양한 화면 비율과 동기화된 오디오로 1080p 비디오를 생성하는 30B 파라메트릭 변환기입니다.
  • 우리(Meta)는 T2V 모델에 대한 다단계 교육 솔루션을 제공합니다. T2I + T2V 공동 훈련으로 인해 수렴 속도가 훨씬 느려지고 품질이 저하됩니다.
  • 텍스트-비디오 평가는 어렵습니다. 자동화된 측정항목은 매우 열악하며 사람의 평가와 좋은 상관관계가 없습니다.

영상으로 만든 '슈퍼 개인'

Meta Movie Gen이 출시된 날 APPSO는 이 최신 비디오 생성 모델을 즉시 보고하고 해석했습니다. 일반적으로 Movie Gen에는 비디오 생성, 개인화 비디오 생성, 정밀 편집 및 오디오 생성의 네 가지 기능이 있습니다.

먼저 가장 기본적인 비디오 세대인 Movie Gen Video를 살펴보겠습니다. 다중 모드 기능을 통해 새로운 모델은 다양한 입력 방법을 사용할 수 있습니다. 사용자는 간단한 텍스트와 몇 가지 프롬프트 단어를 통해 해당 비디오를 직접 생성할 수 있습니다. 필요한 처리 사진을 모델에 넣고 텍스트 요구 사항에 따라 정적 사진을 동적 비디오로 전환합니다.

▲ 프롬프트 텍스트: 한 소녀가 연을 손에 들고 해변을 달리고 있습니다. 그녀는 데님 반바지를 입고 노란색 티셔츠를 입고 있습니다.

Movie Gen에게 비디오 재생성 또는 최적화에 대한 도움을 요청할 수도 있습니다. 어떤 입력 방법을 선택하든 현재 공식 웹사이트에 있는 Movie Gen의 데모 영상은 매우 효과적입니다. 캐릭터의 표현이 자연스럽고 그림의 디테일도 적절합니다. 프롬프트의 단어나 텍스트 요구 사항에 따라 해당 결과를 생성할 수도 있습니다. 더 정확하게.

Andrew Brown은 비디오 생성 과정에서 데이터, 계산 및 모델 매개변수를 확장하고 이를 흐름 일치와 결합하며 간단하고 일반적으로 사용되는 LLM 아키텍처(Llama)로 전환하여 SOTA 비디오 생성 품질을 달성하는 것이 매우 중요하다고 소개했습니다. .

더욱이 새 모델의 T2V, 개인화 및 편집 모델은 모두 동일한 훈련 계획에서 나옵니다. 사전 훈련 중에 Meta는 먼저 T2I를 훈련한 다음 T2V를 훈련합니다. 이 모델을 초기화로 사용한 다음 T2V 사후 학습을 수행하고 T2V 및 V2V 편집을 개인화하는 기능을 학습합니다.

또한 모델의 훈련도 해상도 수준에 따라 먼저 저해상도(256px) 훈련으로, 그 다음 고해상도(768px) 훈련으로 진행됩니다. Meta AI는 T2I + T2V를 공동으로 학습시키려고 시도하지만 이로 인해 이전보다 수렴 속도가 훨씬 느려지고 품질도 저하됩니다.

Movie Gen Video가 사실적인 생성 결과를 얻을 수 있는 이유는 본질적으로 최대 30B 매개 변수 변환기 모델의 뛰어난 기능 때문입니다. 이 모델은 초당 16프레임의 속도로 최대 16초의 비디오를 생성할 수 있으며, 16초 길이의 고품질 및 충실도가 높은 오디오 45초.

메타 관계자도 논문에서 다음과 같이 밝혔습니다.

이러한 모델은 객체 모션, 주체-객체 상호 작용 및 카메라 모션을 추론할 수 있으며 다양한 개념에 대한 합리적인 모션을 학습할 수 있습니다.

이 문장에는 총 세 가지 의미가 있습니다. 첫 번째는 모델 자체가 현실 세계의 물리적 움직임뿐만 아니라 다양한 "상식" 물리 법칙을 복원할 수 있다는 것입니다. 모델 기술이 가장 성공적인 곳입니다.

Movie Gen Video는 물리적 세계의 움직임 패턴을 정확하게 이해할 수 있으며 Meta AI는 많은 노력을 기울였습니다. 팀은 수억 개의 비디오와 수십억 개의 이미지를 대상으로 새 모델에 대한 광범위한 사전 학습을 수행했습니다. 끊임없는 반복, 학습, 요약, 추론 및 적용을 통해 Movie Gen Video는 공식 웹 사이트에서 뛰어난 성과를 거두었습니다.

그러면 모델은 전문 영화의 카메라 움직임, 장면, 몽타주 등을 적극적으로 모방하고 학습할 수도 있습니다. 즉, 무비젠비디오를 통해 제작된 영상 역시 영화촬영과 유사한 전문성과 예술성을 지니고 있습니다.

그러나 Andrew Brown은 텍스트-비디오 평가가 어렵다고 언급했습니다. 자동화된 측정항목은 매우 열악하고 사람의 평가와 잘 연관되지 않기 때문입니다. 즉, 비디오 생성 모델 개발 초기에는 생성 결과가 사람들의 인상과 관찰에서 실제 물리적 세계와 너무 달랐습니다. 결국 Meta는 여전히 전적으로 인간에 의존하여 이러한 판단의 진위 여부를 결정했습니다. 평가.

우리는 비디오 평가를 품질과 정렬의 여러 직교 축으로 나누기 위해 많은 노력을 기울였습니다.

결과 Movie Gen은 1000큐 평가 세트의 모델과 비교할 때 품질 및 일관성 측면에서 전반적으로 승리하거나 동등한 수준입니다.

마지막으로, 모델은 이를 바탕으로 다음 콘텐츠를 추론하고 제작할 수 있습니다. 마치 전문 감독이 사진의 모든 동작을 감독하는 것과 같으며, 숙련된 의성어 아티스트가 동영상 콘텐츠나 텍스트 프롬프트를 기반으로 사운드트랙을 생성하는 것과 같습니다. 실시간으로 사진과 일치합니다.

▲ 불꽃이 터지는 순간의 음향 효과

오디오를 동기적으로 생성하는 기능은 Movie Gen Audio에 의존합니다. 이는 비디오 입력과 비디오와 동기화된 고음질 오디오의 제어 가능한 생성을 위한 옵션 텍스트 프롬프트를 수용하는 13B 매개변수 변환기 모델입니다.

Movie Gen Video와 마찬가지로 Movie Gen Audio도 "대규모" 연습을 수행합니다. Meta AI는 수백만 시간의 오디오 참조를 모델 교육에 제공합니다. 많은 비교와 요약을 거친 후 현재 모델은 사운드와 화면 간의 대응을 마스터했으며 다양한 BGM이 청중에게 전달하는 다양한 느낌까지 이해할 수 있습니다.

따라서 분위기와 환경에 대한 신호 단어의 경우 Movie Gen Audio는 항상 그림과 완벽하게 일치하는 음악을 찾을 수 있습니다.

동시에 주변 사운드, 악기 반주 트랙 및 폴리 사운드를 생성하여 오디오 품질, 비디오-오디오 정렬 및 텍스트-오디오 정렬 측면에서 최첨단 결과를 제공할 수 있습니다.

이로 인해 동종 모델 중 가장 진보된 모델이 되었습니다.

비록 공식 영상처럼 감히 그렇게 자신있게 결론을 내릴 수는 없지만, 공식 영상의 길이, 화질, 배경음악의 적합성 측면에서 이전 영상 세대 모델에 비해 Movie Gen Video는 매우 분명한 발전을 이루었습니다.

게다가, 이전의 아이돌 강자 소라와 비교했을 때, 무비젠은 전반적인 품질과 일관성 측면에서 확실한 선두를 달리고 있습니다. 앤드류 브라운은 이번 소라와의 게임에서 다음과 같이 당당하게 말했습니다.

Movie Gen이 전반적으로 승리합니다.

영상 편집 분야의 "만능 전문가"

Movie Gen Video와 Movie Gen Audio의 협력으로 Meta AI의 새로운 비디오 생성 모델에는 새로운 기능이 추가되었습니다. 그러나 위에서 언급한 발전은 오디오 및 비디오 생성 기능을 갖춘 기술적 기반일 뿐이며 계속해서 확장해 나가고 있습니다. 새로운 모델은 적용 범위를 통해 개인화된 비디오 생성을 지원할 수 있습니다.

이름에서 알 수 있듯이 개인화는 사용자 요구를 결합하고 요구 사항에 따라 지정된 비디오 콘텐츠를 생성하는 것입니다.

이전 비디오 모델도 개인화된 결과를 생성할 수 있지만 결과는 항상 만족스럽지 않습니다. 세부 사항을 변경할 수 없어 처음부터 다시 시작해야 하거나 세부 사항이 계속 변경되면 사진의 다른 요소를 유지할 수 없습니다. 일관성이 항상 어느 정도 영향을 받습니다. 새로운 비디오의 생성으로.

Movie Gen Video의 공식 웹사이트 시연은 이러한 측면에서 그들의 장점을 잘 보여줍니다. 새로운 모델은 프롬프트 단어/참조 이미지의 요구 사항에 따라 개인화된 비디오를 생성할 수 있을 뿐만 아니라 비디오를 기반으로 세부 사항을 지속적으로 최적화 및 조정하고 생성된 다른 콘텐츠가 방해받지 않도록 보장하는 것이 "미세 수정"입니다.

전문적인 기술이 필요하거나 정밀도가 부족한 기존 생성 도구와 달리 Movie Gen은 원본 콘텐츠를 보존하고 관련 픽셀만 대상으로 합니다.

우리 모델은 인간의 정체성과 행동을 보존하는 개인화된 비디오를 제작하는 데 있어 최첨단 결과를 달성합니다.

이 기능은 많은 셀프 미디어 스튜디오나 비디오 편집이 필요한 사람들에게 매우 유용합니다. 변경된 개체를 전체적으로 수정하거나 세부적으로 수정할 수 있습니다. 텍스트를 기반으로 전체 그림을 재생성하는 것만큼 큰 것일 수도 있고, 캐릭터의 머리 색깔, 안경 스타일 등을 변경하는 것만큼 작은 것일 수도 있습니다. 예를 들어, 모델을 사용하여 배경에서 불필요한 혼란을 제거할 수 있습니다.

또는 원본 비디오에 새로운 배경을 부여할 수 있으며, 스타일이든 색상이든 언제든지 변경할 수 있으며 몇 초 만에 낮을 밤으로 바꿀 수도 있습니다.

또한 Movie Gen Video는 영상의 구성과 전체적인 그림을 그대로 유지하면서 많은 세부 사항을 미세하게 조정할 수 있으며 캐릭터의 의상 색상, 안경 착용 스타일, 본체 의상, 애완 동물 털 색상도 변경할 수 있습니다. , 등.

예를 들어 영상 속 불필요한 잡동사니를 제거하는 것, 사진의 배경 스타일을 바꾸는 것, 영상에 디테일을 추가하는 것, 피사체의 옷 색깔을 바꾸는 것 등이 모두 그의 장점이다.

그러나 이것은 단지 환상일 뿐입니다. Movie Gen Video는 현재 1080P, 16초, 초당 16프레임의 고화질 긴 비디오 또는 최대 45초의 고품질 및 고음질 오디오만 지원하기 때문입니다. 이런 종류의 사진 해상도와 비디오 길이는 창의적인 요구가 있는 개인이나 회사에는 충분하지 않은 것 같습니다.

그러나 이러한 기술적 혁신으로 인해 AI는 무한한 조정, 개인화 및 정밀한 조정을 통해 비디오 파일을 편집할 수 있게 되었습니다. 또한 Movie Gen Video는 내년까지는 비디오 더빙의 문을 열었습니다. 아직 공식적으로 대중에게 공개되지는 않았지만, 현재의 공식 시연 결과로 볼 때 영상, 영화, TV, AI 산업에 새로운 활력을 불어넣고 심지어 새로운 혁명을 가져올 가능성도 정말 높다.

Movie Gen Video를 포함한 가장 최신의 최첨단 도구는 비디오 생성 분야에서 AI에 대한 이러한 고정관념을 깨기 위해 노력하고 있지만, 현재의 기능으로는 아직 갈 길이 멀습니다.

영상세대 모델들이 처음에는 일반인들의 일상에 직접적으로 영향을 미치거나 감동을 주는 것조차 어려울 수 있다. AI가 만든 특정 영화가 만들어져서야 신선함이라는 측면에서 대중의 관심을 끌 수 있을 것이다. 현재 AI로 제작되는 영화, TV 시리즈, 애니메이션은 비현실적인 이미지와 일관되지 않은 움직임 등의 단점을 가지고 있습니다.

Meta AI는 또한 공식 웹 사이트를 통해 모델 기술이 향상되고 발전함에 따라 영화 제작자 및 제작자와 긴밀히 협력하여 피드백을 통합할 것이라고 밝혔습니다. 현재는 Runway든 Sora든 최신 Meta AI든 모두 빠르게 발전하고 있습니다. 적어도 1년 전의 세대 결과와 비교하면 눈에 띄는 발전을 볼 수 있습니다.

AI 기술이 사람들의 삶에 미치는 영향은 즉각적으로 드러나지 않을 수 있습니다. 모두가 여전히 "AI의 용도"에 대해 논의할 때 대부분의 사람들에게 가장 중요한 의미는 AI에 유용한 도구, 즉 재미있는 장난감이 하나 더 있다는 것입니다.

헐리우드에서 크게 성공하려는 영화제작자이든 관객을 위한 비디오 제작을 즐기는 제작자이든 우리는 모든 사람이 자신의 창의성을 향상시키는 데 도움이 되는 도구에 액세스할 수 있어야 한다고 믿습니다.

# Aifaner: Aifaner(WeChat ID: ifanr)의 공식 WeChat 공개 계정을 팔로우하신 것을 환영합니다. 더 흥미로운 콘텐츠가 최대한 빨리 제공될 예정입니다.

Ai Faner | 원본 링크 · 댓글 보기 · Sina Weibo


게시됨

카테고리

작성자

태그: