AI 이미지 생성이 큰 진전을 이루었습니다.

우리는 한동안 AI가 생성한 이미지를 가지고 살아왔지만 이번 주에는 일부 주요 기업들이 큰 진전을 이루었습니다. 특히 Google의 새 모델인 Midjourney 및 Grok 에 대한 중요한 업데이트에 대해 이야기하고 있습니다.

각 회사는 서로 다른 속도와 방향으로 기술이 발전하고 있음을 보여줍니다. 이는 여전히 매우 개방적인 경쟁의 장이며 각 회사는 얼마나 발전했는지 보여줍니다.

Midjourney가 웹에 접속합니다.

웨스 앤더슨의 해리포터 수영장 옆에 있는 덤블도어 교수.
Midjourney에서 생성된 AI 이미지. 채널/중간

여러 가지 유용한 이미지 조작 도구를 단일 사용자 인터페이스로 통합한 새로운 웹 편집기를 목요일 늦게 조용히 출시한 Midjourney부터 시작해 보겠습니다.

이전에는 재구성, 다시 그리기(AI 생성 자산을 기존 이미지에 추가 또는 수정), 패닝, 캔버스 확장(이미지 경계 확장 및 채울 콘텐츠 생성), 확대/축소와 같은 기능을 사용하려면 고유한 특정 도구가 필요했습니다. 여러 메뉴에 걸쳐 배치되어 제작자가 계속해서 앞뒤로 전환해야 했습니다. 이 새로운 UI는 Discord에서의 프로그램 시작과 크게 다른 더욱 일관되고 간소화된 편집 프로세스를 제공합니다.

최근 Discord에서 Midjourney CEO인 David Holz 에 따르면 새로운 웹 편집기는 AI 생성 이미지를 더 쉽고 원활하게 편집할 수 있도록 설계되었습니다. "우리는 이것이 MJ 이미지 편집을 이전보다 훨씬 더 원활하게 만들고 큰 진전이라고 생각합니다."라고 그는 썼습니다.

Midjourney는 계속해서 Discord에서 웹 기반 애플리케이션으로 이전하고 있지만, 회사는 웹 간에 "daily-theme", "prompt-craft" 및 "general-1"과 같은 인기 채널의 메시지를 미러링할 것이라고 발표했습니다. 사람들이 선호하는 플랫폼에서 해당 스레드를 따라갈 수 있도록 방과 Discord 채널을 제공합니다. 또한 이 회사는 디지털 브러시처럼 작동하고 사각형 선택 도구와 올가미 도구를 모두 대체하는 새로운 선택 도구를 도입했습니다.

새로운 편집기는 플랫폼에서 이미 10개 이상의 이미지를 생성한 모든 Midjourney 사용자가 사용할 수 있습니다. 제작자 커뮤니티의 초기 반응은 대체로 긍정적이었습니다.

편집기는 Midjourney 6.1이 출시된 지 2주 후에 제공됩니다. 이 버전은 이미지 품질과 일관성(정확한 손가락 수 등)을 향상했을 뿐만 아니라 처리 시간을 크게 개선하고 이미지 프롬프트의 텍스트 정확성을 이해합니다.

Grok-2가 괴물을 풀어줍니다.

Midjourney 업데이트는 또한 Elon Musk의 xAI 스타트업이 Grok-2를 출시한 지 이틀 만에 제공되는데, 이는 이번 주에 일어난 다음 큰 일입니다.

Grok의 이미지 생성 기능은 인상적인 이미지 품질과 무료 사용으로 인해 빠르게 인기를 얻고 있는 Black Forrest Lab의 Flux.1 모델을 기반으로 합니다.

Grok-2의 가장 큰 논란은 품질(매우 좋음)뿐만 아니라 정의되지 않은 것처럼 보이는 지침입니다. 다른 많은 AI 이미지 생성기와 달리 Grok-2에는 지적 재산, 폭력 및 기타 노골적인 콘텐츠에 대한 지침이 거의 없는 것으로 보입니다. AI 이미지 생성기가 이러한 유형의 실수를 본 것은 처음이 아니지만 Grok의 경우 의도적인 것으로 느껴지며 Musk는 이를 "세계에서 가장 재미있는 AI"라고 부릅니다.

사람들은 이미 그 한계를 테스트하고 AI 이미지 생성 초기를 연상시키는 온갖 종류의 끔찍하고 기괴한 이미지를 만들어냈습니다. 그러나 Musk의 수사를 믿는다면 Grok-2의 지침 부족은 목적이 있는 것처럼 보이며 결국 이 기술이 미래에 어떻게 발전할지를 결정하게 될 수 있습니다.

Google, Imagen 3로 경쟁력 확보

Google의 Imagen-3 모델로 생성된 AI 이미지입니다. Google

마지막으로 Google은 목요일에 모든 미국 사용자에게 출시 된 새로운 Imagen 3 AI 모델을 발표했습니다. Google은 이를 "최고 품질의 텍스트-이미지 모델"이라고 부르며 이제 "이전 모델보다 더 나은 디테일, 더 풍부한 조명 및 산만한 아티팩트가 거의 없음"을 생성할 수 있습니다. Google은 또한 Imagen-3가 텍스트 렌더링에 더 뛰어나며 이제 빠른 스케치와 같은 가벼운 버전이나 훨씬 더 상세하고 고해상도의 작업을 위해 제작된 다양한 버전으로 제공된다고 말합니다.

현재 Imagen 3는 ImageFX의 일부로 Google의 AI Test Kitchen을 통해서만 사용할 수 있습니다. 현재 비공개 베타 버전이므로 아직 참가자가 아닌 경우 대기자 명단에 등록해야 합니다.


게시됨

카테고리

작성자

태그: