為何3D布局是AI影片生成中缺失的一環

呢啲文章喺Utopai Studios仲叫做Cybever嘅時候發佈。隨住我哋平台不斷演變,部分內容可能已經過時,但我哋特意將呢啲文章保留喺度,作為我哋發展歷程嘅記錄。

AI 影片生成嘅前景令人振奮。圖像識自己動起嚟、場景自己建構、故事由一句文字提示浮現出嚟。但任何試過生成長篇內容或者多鏡頭場面嘅人都好清楚目前嘅限制:幾何結構會走樣、鏡與鏡之間視覺唔一致,仲有整體缺乏導演掌控。

這些問題唔止係技術上嘅小麻煩,而係創作上嘅致命傷。

  • AI生成場景缺乏跨鏡頭一致性
  • 喺生成環境中精確控制鏡頭運動相當困難
  • 手動建立3D場景模型成本依然高昂,尤其喺影視行業

因此,在Cybever,我們相信解決方案在於結構——具體來說,就是3D佈局。

我們問自己一個簡單的問題:3D場景能否為AI生成影片帶來其迫切需要的連貫性與控制力?

為此,我們的研究團隊開發了3DTown,這是一套能夠從單一俯視圖像生成完整3D城鎮景觀的新系統。該研究最近於arXiv發表,提出了一套強大的方法,可從單一2D輸入建構細節豐富、語義準確的3D環境。

3DTown 毋須依賴耗費大量人力的手動建模,而是運用 AI 解讀空間關係,建構出完整的 3D 場景,當中包含道路、建築物及其他環境結構,同時兼顧視覺逼真度與幾何一致性。最終成果是一個可完全導航、空間連貫的 3D 環境,為 AI 影片生成奠定理想基礎。

這項研究不單是技術上的里程碑,更是一次範式轉移。它讓我們不再將構圖佈局視為事後補充,而是把它當作首要的創作工具。它是導演願景與AI驅動渲染之間的連結脈絡。

而憑藉3DTown的速度與準確度,我們最初問題的答案如今已顯而易見:沒錯——3D佈局解鎖了AI影片一直所欠缺的掌控力與一致性。

我們將這個挑戰拆解如下:

  1. 由3D開始 – 當你以幾何結構同佈局作為場景基礎,每個畫面都清楚知道自己身處何方、周圍有咩。咁就可以解決時間同空間上嘅不一致問題。

  2. 要快 – 我哋嘅3DTown系統可以從單一地图生成複雜嘅3D城鎮景觀,將以往需要花幾星期人手建模嘅工序,縮短到只需幾分鐘。

  3. 之後交畀AI – 一旦有咗結構化嘅3D場景,我哋嘅AI工具就可以疊加喺上面,生成材質、填補細節,甚至喺一個一致、由佈局驅動嘅基礎上渲染出最終嘅電影級視覺效果。

這種做法唔單止關乎視覺像真度,而係關乎創作自由。

導演而家可以直接用粗糙嘅3D預覽嚟勾勒或者鋪排一場戲。嗰個模型就成為咗畫布,AI喺上面渲染出多種視覺風格或者剪接。導演可以修改鏡頭而唔使將所有嘢重新渲染。片廠唔再需要畀錢請美術師由零開始起複雜嘅場景模型。取而代之,3DTown按需要即時創造出高質素嘅3D場景。場景喺唔同鏡頭、攝影機角度同剪接之間保持一致。呢一點令空間邏輯喺wide shot、特寫同移動攝影機之間保持完整——對敘事清晰度嚟講至關重要。

成果:3DTown如何印證此模式行之有效

在我們最近的研究中,3DTown相較於業界頂尖方法展現出顯著改進:

  • 72% 的人類評分員偏好我們的 3D 重建成果

  • 75% 表示環境符合預期的道路及建築佈局

  • 92% 在基於 GPT-4o 的評估中,於紋理及結構保真度方面獲得偏好
__wf_reserved_inherit
人類偏好勝出率:
__wf_reserved_inherit
基於GPT4o嘅加權勝率:
__wf_reserved_inherit
質性比較:

呢啲唔單止係學術上嘅成就,仲可以直接轉化成更順暢嘅製作流程、更少嘅修改,以及為電影工作者同創作者帶嚟更好嘅成果。 

最終,我們的目標是賦能一種全新嘅工作流程,喺當中:

  • 導演透過構圖與動態界定鏡頭,而非最終渲染畫面
  • AI負責處理渲染風格、燈光及視覺潤飾
  • 藝術家與技術人員圍繞結構化幾何協作,而非扁平像素

這就是我們將AI化為創作放大器——而非取代者——的方式。 

在娛樂產業中,視覺連貫性與導演掌控至關重要,3DTown 為預覽視覺化帶來零訓練成本的解決方案。就研究及工業應用而言,它建立了一套從一開始就保留空間邏輯與視覺逼真度的製作流程。

閱讀更多