영화, 텔레비전 수준의 단편영화를 10초 만에 수확했고, 화려한 카메라 움직임의 본체는 여전히 선명하다. 이 새로운 국산 비디오 모델은 안정적이다.

Vincent Video의 트랙은 점점 더 활발해지고 있으며, 2주마다 업데이트되고 매달 반복됩니다. 머스크는 모델로서 너무 바쁩니다. 롤링이 정말 쉽습니다. Doubao의 비디오 생성 모델은 새로 디자인된 확산 모델을 제공하여 영화 및 TV 수준의 현실감과 매우 역동적이고 복잡한 장면에 대한 현실적인 세부 정보를 보여줍니다. 효과를 설명하려면 한 문장을 사용하십시오. 매우 강하고, 매우 폭발적이며, 내 눈을 믿을 수 없습니다.

9월 24일, 2024년 화산 엔진 AI 혁신 투어가 심천을 방문하여 새로운 비디오 생성 모델을 출시하여 전체 AI 비디오 트랙에 대해 두 개의 폭탄을 동시에 떨어뜨렸습니다: Doubao Video Generation-PixelDance, Doubao Video Generation-Seaweed 두 개의 대형 모델.

알고리즘 등록을 통과한 중국 최초의 대규모 기본 모델 제조업체 중 하나로서 Vincent Video의 궤도에 진입한 것은 놀라운 일이 아닙니다. 사람들이 기대하게 만들기도 합니다. 또 어떻게 굴릴 수 있을까요? 이 강력한 국산 모델의 실제 테스트에 참가한 결과, 그 힘은 확실히 이미지를 생성하는 것뿐만 아니라 더 큰 생태와 비전을 가지고 있음을 발견했습니다.

의미론적 이해와 일관성의 중요한 혁신, 렌즈 언어를 완전히 마스터함

생성 비디오의 "마법"은 "저주"에서 비롯됩니다.

즉, 모델의 의미론적 이해 능력이 바탕이 됩니다. 프롬프트의 텍스트 내용을 정확하게 이해해야만 예상한 그림이 제대로 표시될 수 있습니다. 먼저 "독해"를 이해해야 합니다.

이번에는 APPSO가 내부 테스트에 참여하여 매우 강력하고 폭발적인 놀라운 결과를 얻었습니다.

▲ 프롬프트: 앞치마와 장갑을 끼고 있는 새끼 고양이가 거품이 가득한 양동이에서 설거지를 하고 있습니다. 위는 물이 나오는 수도꼭지입니다.

프롬프트에 표시된 모든 요소가 반영되었습니다. "누락된 질문"이 없습니다. 유일한 문제는 너무 아름답습니다. 내 고양이는 그런 고급 기질이 없습니다.

잊어버리세요. 새끼 고양이가 무슨 잘못을 할 수 있을까요? 이미징 관점에서 보면 거품과 물의 흐름의 디테일이 매우 놀랍고 고양이의 자랑스러운 표정도 매우 생생합니다.

작은 디테일: 물이 새끼 고양이의 머리 위로 떨어지고, 등과 턱에서 떨어지는 디테일은 물리학 법칙을 따르며 모델의 강력한 이해력을 보여주기에 충분합니다. 공식 시연에서도 비슷한 성능을 볼 수 있다.

▲공식 데모

바람에 흩날리는 머리카락의 복원은 흩날리는 머리카락을 반영할 뿐만 아니라, 방향도 캐릭터의 움직임 리듬과 일치하여 물리적 논리와 일치한다.

이러한 고충실도 기능은 Douyin과 Jianying이 자체 개발한 높은 압축률과 높은 복원성 비디오 숨겨진 상태 인코딩 및 디코딩 모델을 통해 비디오 제작에 대한 이해와 기술 축적에서 비롯됩니다. 이는 확산 모델의 효율적인 인코딩을 강력하게 보장합니다. 작업.

▲ 프롬프트: 나무가 울창한 숲에서 하늘을 올려다보세요. 하늘은 울창한 나뭇잎으로 덮여 있고, 나뭇잎 사이로 햇빛이 비치고 있습니다. 상향 촬영 각도, 밝은 부분과 어두운 부분의 강한 대비

그린 톤은 굉장히 까다로운 톤인데 잘 조절하면 레트로하고 산뜻해 보이지만, 잘못 조절하면 톤이 떨어져 나가거든요. 여기서는 녹색 잎과 가지를 통해 빛이 굴절되어 형성되는 조리개 효과가 렌즈에 가까운 정확하게 복원됩니다.

비디오 편집 및 Jimeng AI와 같은 비즈니스 시나리오를 반복적으로 다듬고 지속적으로 반복한 결과 Doubao 비디오 생성 모델은 진정한 전문가 수준의 빛과 그림자 레이아웃 및 색상 조정 기능을 갖추고 3D 애니메이션, 2D 애니메이션, 중국어를 지원합니다. 페인팅, 흑백, 임파스토 등 다양한 스타일, 그리고 더 중요한 것은 렌즈 언어를 마스터하는 것입니다.

멋진 카메라 움직임, 어떻게 움직임이 바뀌어도 주인공은 안정적입니다.

렌즈 언어의 중요성은 아무리 강조해도 지나치지 않습니다. 다이나믹한 PPT를 만드는 데 혼자서 오랜 시간을 보내고 싶은 사람은 없습니다.

그러나 일반 사용자의 경우 "렌즈 언어" 교육 수업을 받을 필요가 없습니다. Doubao 비디오 생성 모델은 줌, 서라운드, 팬, 줌, 대상 추적 및 기타 슈퍼 멀티에 이르는 일련의 렌즈 작동 솔루션을 준비했습니다. -렌즈 언어는 프롬프트를 사용하여 관점을 유연하게 제어할 수 있습니다.
쉬워 보이지만 구현하기가 쉽지 않습니다. 일관성은 큰 과제입니다.

모델은 지침을 이해하고 피사체를 생성한 다음 렌즈 요구 사항에 따라 피사체의 변화와 동작 궤적을 설계합니다. 이 일련의 단계에서는 피사체의 얼굴이 "변하지 않아야" 할 뿐만 아니라 피사체도 바뀌어야 합니다. 움직임과 각도에 따라 적절하게 "변수"를 지정합니다.

▲ 프롬프트 : 우주복을 입은 보더 콜리가 달 표면을 달리며 공중에 날아다니는 원반을 쫓으며 뛰어오르고 있다. 달빛은 비스듬한 각도, 낮은 각도, 4k 품질, 슬로우 모션으로 털을 비춥니다.

강아지가 뛰어오를 때 머리와 팔다리가 크게 변형되지 않고 안정적이고 안정감을 느꼈습니다.

▲ 프롬프트 : 머스크는 머리에 밀짚모자를 쓴 채 논밭에 서서 몸을 굽혀 벼를 심고 있다.

그가 카메라를 향해 말하는 10초 동안 머스크의 표정, 팔, 몸의 자세 등이 그의 움직임에 따라 모두 바뀌었지만, 전체적으로 무너지지 않고 일련의 움직임이 매우 매끄러웠다.

이러한 "변화"와 "불변성"이라는 과제를 다루는 데 있어 주제의 일관성이 거의 완벽하게 보장되며 성능이 정말 강력합니다.

렌즈를 교체할 때도 동일한 원리가 적용됩니다. 공식 데모에는 인상적인 수중 부분이 있습니다.

▲공식 데모

모델이 달성해야 하는 간단한 렌즈 줌은 앞에 절묘한 디테일이 있어야 하고, 피사체가 이동하여 새로운 피사체를 드러내고, 마지막으로 새로운 피사체에 안착하면 전체 큰 움직임이 한 번에 완료되는 것입니다. 가다.

뛰어난 일관된 성능과 놀라운 카메라 이동 기능 외에도 3D, 2D 애니메이션, 임파스토, 만화 등 다양한 스타일과 다양한 비율 옵션을 자연스럽게 지원하여 사용자에게 매우 자유로운 선택을 제공합니다. .

▲공식 데모

▲ 프롬프트: 아름다운 눈 덮인 도쿄 도시는 번화한 도시 거리를 따라 이동하며, 아름다운 눈 덮인 날씨를 즐기고 근처 노점에서 쇼핑하는 여러 사람을 따라 화려한 벚꽃 꽃잎이 눈꽃과 함께 날아갑니다.

▲ 프롬프트 : 밤 홍콩의 교차로에는 자동차와 버스가 유려한 선을 이루며 빠르게 지나간다. 신호등을 기다리는 보행자가 있습니다. 배경의 건물이 흐릿하여 밝은 점, 낮은 각도, 4k 품질을 형성합니다.

"고급형"에서 "구현 용이성"까지

Doubao 비디오 생성 모델이 이제 막 사용자에게 공개되었지만 그 뒤에 있는 기술은 오랫동안 다듬어졌습니다. 지난해 11월 ByteDance Research가 발표한 기술 보고서에 따르면 Byte 팀은 첫 번째 프레임 이미지 지침과 마지막 프레임 지침을 텍스트 지침과 결합하여 복잡한 장면이나 액션을 만드는 데 핵심 구성 요소임이 입증되었습니다.

또한 당시 Byte는 높은 안정성의 영상 성능을 달성하기 위해 계층적 방법 대신 자동 회귀 경로를 선택했습니다. 이에 대한 고려 사항은 모델이 생성된 콘텐츠가 사용자 기대와 일치하는지 확인해야 한다는 것입니다. 이러한 방식으로만 사용자가 생성 프로세스에 적극적으로 참여하고 "감독" 역할을 수행하여 강력한 모델 기능이 구현될 수 있습니다. 가능한 한 빨리 실용적인 응용 프로그램.

유사한 제품(선물 제외)과 비교할 때 Doubao의 비디오 생성 모델은 완전히 1급 수준입니다. Luma 및 Runway와 같은 외국 제품과 비교하여 중국 및 중국 사용자를 더 잘 이해하고 중국 인터넷의 창의적인 작업 흐름에 더 적합합니다.

▲공식 데모

이렇게 뛰어난 성능으로 눈에 띄는 것은 불가피합니다. 이는 비디오 생성 모델뿐만 아니라 전체 Doubao 대형 모델 제품군을 의미합니다. 중국에서 알고리즘 등록을 통과한 최초의 대형 모델 중 하나인 Doubao 대형 모델은 Volcano Engine 및 Volcano Ark를 통해 기업에 서비스를 제공합니다.

9월 현재 Doubao 언어 모델의 일일 평균 토큰 사용량은 1조 3천억을 넘어섰으며, 이는 5월 첫 출시보다 10배 증가한 수치입니다.

가장 강력한 성능을 제공하기 위해 Doubao Universal Model Pro는 기본적으로 800K의 초기 tpm을 지원합니다. 이 수치는 업계 최고 수준을 훨씬 초과하며 실제 필요에 따라 더욱 확장되어 대기업에 도움이 될 수 있습니다. 생산 환경에서 대규모로 안전하게 작동합니다.

기술적 역량은 그토록 강력한 반면, 다양한 대형 모델의 가장 강력한 버전과의 가격 비교에서 Doubao의 대형 모델은 업계 가격보다 98% 이상 저렴합니다. 즉, AI를 사용할 수 있는 문턱이 그 어느 때보다 낮아졌습니다.

기술이 발전할수록 이를 일상생활에 구현하고 통합해야 하는 필요성도 커집니다.

실제 비즈니스 시나리오에서 필요한 것은 좋은 결과, 빠른 속도, 사용하기 쉬운 것입니다. 전자상거래를 예로 들면, 마케팅 노드와 다양한 플랫폼의 디스플레이 효과를 모두 고려해야 합니다. 유연하고 빠른 생산 방식이 필요합니다.

광고 촬영, 단편 영상, 라이브 전자상거래 등 다양한 분야를 막론하고 기존 제작 과정에 간단하고 사용하기 쉬운 도구가 내장되어야 합니다.

24일 기자회견에서 Tan Dai Volcano Engine 사장은 일련의 대규모 모델 적용 사례를 시연했으며, 특히 실제로 상업적 사용 시나리오에서 구현된 사례를 선보였습니다.
Huoshan Engine은 풀 스택 대형 모델 서비스를 통해 Doubao 대형 모델의 강점을 실제 비즈니스 시나리오에 통합합니다. 올해부터 Volcano Engine은 다양한 비즈니스와 시나리오를 다루는 소매 대형 모델 생태 연합, 자동차 대형 모델 생태 연합 및 스마트 터미널 대형 모델 연합을 설립했습니다.

더 강력한 모델, 더 낮은 가격, 더 쉬운 구현은 의심할 여지 없이 빈백 모델의 중요한 장점입니다.

"강력한 모델" 말할 필요도 없이 Doubao 대형 모델은 매일 1조 개가 넘는 토큰의 사용을 지원할 수 있습니다. ByteDance의 내부 50개 이상의 비즈니스 관행과 30개 이상의 업계 고객의 애플리케이션을 통해 점점 더 많은 장면을 포괄하는 호출이 발생합니다. . 기업으로부터 더 많은 피드백을 받는 동시에 Baoda 모델이 더 우수하고 포괄적이 되는 데에도 도움이 됩니다.

기자회견에서 Tan Dai는 "대형 모델의 적용 비용이 잘 해결되었습니다. 대형 모델은 더 나은 모델 기능과 서비스를 통해 볼륨 가격에서 볼륨 성능으로 전환해야 합니다."라고 말했습니다.

"상업 시나리오의 적용은 Doubao·Video Generation 모델이 처음부터 고려한 것입니다. 더 잘 적용하려면 상업적 가치의 획기적인 발전이 필요합니다. 우리는 다양한 시나리오에서 충분히 해냈습니다. 적응, 이것이 비즈니스 환경에서 콩바오 비디오 생성 모델을 통해 모든 사람이 비즈니스를 진정으로 혁신하고 가속화할 수 있습니다.”

매니아들은 낮은 임계값의 C-end 제품을 통해 AI 세계 탐험을 시작할 수 있습니다. 개발자는 Volcano Engine을 사용하여 AI 작업을 보다 저렴하고 다양하며 유연한 방식으로 구현하고 추가 탐색을 위한 새로운 제품과 콘텐츠로 더 넓은 사용자 기반을 제공할 수 있습니다.

이어진 기자들과의 질의응답에서도 그는 기술이 계속해서 반복되고 발전함에 따라 AI가 문제를 완전히 해결할 수 있을 때 toB와 toC의 차이는 그리 크지 않을 수도 있다고 밝혔습니다.

아마도 이것은 AI 시대의 가장 극적인 광경이 될 것이다. 원래는 도달할 수 없었던 장벽이 무너지고 있는 것이다. 경험이 있든 없든, 비즈니스 역량 강화를 위한 것이든 자신의 오락을 위한 것이든, 시작하기만 하면 기적을 만들 수 있습니다.

# aifaner 공식 WeChat 공개 계정: aifaner(WeChat ID: ifanr) 팔로우를 환영합니다. 더 흥미로운 콘텐츠가 최대한 빨리 제공될 예정입니다.

Ai Faner | 원본 링크 · 댓글 보기 · Sina Weibo


게시됨

카테고리

작성자

태그: