3D 레이아웃이 AI 비디오 생성에서 빠진 연결 고리인 이유

These posts were published when Utopai Studios was known as Cybever. As our platform has evolved, some content may be outdated, but we've kept these articles here as a record of our journey.

AI 비디오 생성의 약속은 흥미진진합니다. 움직이는 이미지, 스스로 구축되는 장면, 텍스트 프롬프트에서 나오는 이야기까지. 하지만 긴 형식의 콘텐츠나 여러 컷의 장면을 생성해 본 사람이라면 현재의 한계를 잘 알고 있을 것입니다: 변형되는 지오메트리, 프레임 간 시각적 불일치, 그리고 전반적인 연출 제어의 부재.

이러한 문제들은 단순한 기술적 불편이 아닙니다. 창의성에 치명적입니다.

  • AI 생성 장면은 컷 간 일관성이 부족합니다
  • 생성된 환경에서 카메라 움직임을 정밀하게 제어하기 어렵습니다
  • 특히 영화 및 TV 산업에서 수동으로 3D 장면 모델을 만드는 것은 비용이 많이 듭니다

그래서 Cybever에서는 해결책이 구조, 특히 3D 레이아웃에 있다고 믿습니다.

우리는 간단한 질문을 던졌습니다: 3D 장면이 AI 생성 비디오에 절실히 필요한 일관성과 제어를 가져올 수 있을까?

이에 답하기 위해 연구팀은 단일 탑다운 이미지에서 전체 3D 타운스케이프를 생성할 수 있는 새로운 시스템 3DTown을 개발했습니다. 최근 arXiv에 게재된 이 연구는 단일 2D 입력에서 풍부하고 의미론적으로 정확한 3D 환경을 구축하는 강력한 접근 방식을 소개합니다.

3DTown은 노동 집약적인 수동 모델링에 의존하는 대신 AI를 활용하여 공간 관계를 해석하고 도로, 건물 및 기타 환경 구조물로 채워진 완전한 3D 장면을 구성하면서 시각적 충실도와 기하학적 일관성을 유지합니다. 그 결과 완전히 탐색 가능하고 공간적으로 일관된 3D 환경이 만들어지며, 이는 AI 비디오 생성을 위한 이상적인 기반이 됩니다.

이 연구는 단순한 기술적 이정표가 아니라 패러다임의 전환입니다. 레이아웃을 부수적인 것이 아니라 일급 창의적 도구로 취급할 수 있게 해줍니다. 이는 연출자의 비전과 AI 기반 렌더링 사이의 연결 조직입니다.

그리고 3DTown의 속도와 정확성 덕분에 원래 질문에 대한 답은 이제 분명합니다: 그렇습니다 – 3D 레이아웃은 AI 비디오가 놓치고 있던 제어와 일관성을 제공합니다.

우리가 이 문제를 해결한 방법은 다음과 같습니다:

  1. 3D로 시작 – 장면을 지오메트리와 레이아웃에 고정하면 모든 프레임이 자신의 위치와 주변을 알 수 있습니다. 이는 시간적, 공간적 불일치를 해결합니다.

  2. 빠르게 만들기 – 3DTown 시스템은 단일 지도에서 복잡한 3D 타운스케이프를 생성하여 수주가 걸리던 수동 모델링을 단 몇 분으로 단축합니다.

  3. AI가 그 다음을 처리 – 구조화된 3D 장면이 있으면 AI 도구를 레이어링하여 텍스처를 생성하고 세부 사항을 채우며 일관된 레이아웃 기반 위에 최종 시네마틱 비주얼을 렌더링할 수 있습니다.

이 접근 방식은 단지 시각적 충실도에 관한 것이 아니라 창의적 자유에 관한 것입니다.

감독은 이제 거친 3D 프리비즈로 장면을 스케치하거나 블로킹할 수 있습니다. 그 모델은 AI가 다양한 비주얼 스타일이나 편집을 렌더링하는 캔버스가 됩니다. 감독은 모든 것을 다시 렌더링하지 않고도 샷을 수정할 수 있습니다. 스튜디오는 더 이상 복잡한 장면을 처음부터 모델링하기 위해 아티스트에게 비용을 지불할 필요가 없습니다. 대신 3DTown이 주문형 고품질 3D 장면을 생성합니다. 장면은 다양한 샷, 카메라 각도, 편집에서도 일관성을 유지합니다. 이는 와이드 샷, 클로즈업, 움직이는 카메라에서 공간 논리를 유지하여 내러티브 명확성에 필수적입니다.

결과: 3DTown이 모델의 작동을 증명하는 방법

최근 연구에서 3DTown은 업계 최첨단 방법보다 크게 개선된 성능을 보여주었습니다:

  • 인간 평가자의 72%가 우리의 3D 재구성을 선호했습니다

  • 75%가 환경이 예상되는 도로 및 건물 레이아웃과 일치한다고 답했습니다

  • GPT-4o 기반 평가에서 텍스처 및 구조 충실도에 대해 92% 선호도를 기록했습니다
인간 선호 승률:
GPT4o 기반 가중 승률:
정성적 비교:

이것들은 단지 학문적 성과가 아닙니다. 이는 더 깔끔한 제작 파이프라인, 더 적은 수정, 그리고 영화 제작자와 크리에이터에게 더 나은 결과로 직접 이어집니다. 

궁극적으로 우리의 목표는 다음과 같은 새로운 작업 흐름을 가능하게 하는 것입니다:

  • 감독은 최종 렌더링이 아닌 레이아웃과 움직임으로 샷을 정의합니다
  • AI는 렌더링 스타일, 조명, 시각적 폴리싱을 처리합니다
  • 아티스트와 기술자는 평평한 픽셀이 아닌 구조화된 지오메트리 위에서 협업합니다

이것이 우리가 AI를 창의성의 증폭기로 만드는 방법입니다 – 대체자가 아닙니다. 

시각적 연속성과 연출 제어가 가장 중요한 엔터테인먼트 산업에서 3DTown은 프리비주얼라이제이션을 위한 무료 교육 비용 솔루션을 제공합니다. 연구 및 산업 응용 분야에서는 공간 논리와 시각적 충실도가 처음부터 보존되는 파이프라인을 구축합니다.

Read more