
呢啲文章喺Utopai Studios仲叫做Cybever嘅時候發佈。隨住我哋平台不斷演變,部分內容可能已經過時,但我哋特意將呢啲文章保留喺度,作為我哋發展歷程嘅記錄。
AI 影片生成嘅前景令人振奮。圖像識自己動起嚟、場景自己建構、故事由一句文字提示浮現出嚟。但任何試過生成長篇內容或者多鏡頭場面嘅人都好清楚目前嘅限制:幾何結構會走樣、鏡與鏡之間視覺唔一致,仲有整體缺乏導演掌控。
這些問題唔止係技術上嘅小麻煩,而係創作上嘅致命傷。
因此,在Cybever,我們相信解決方案在於結構——具體來說,就是3D佈局。
我們問自己一個簡單的問題:3D場景能否為AI生成影片帶來其迫切需要的連貫性與控制力?
為此,我們的研究團隊開發了3DTown,這是一套能夠從單一俯視圖像生成完整3D城鎮景觀的新系統。該研究最近於arXiv發表,提出了一套強大的方法,可從單一2D輸入建構細節豐富、語義準確的3D環境。
3DTown 毋須依賴耗費大量人力的手動建模,而是運用 AI 解讀空間關係,建構出完整的 3D 場景,當中包含道路、建築物及其他環境結構,同時兼顧視覺逼真度與幾何一致性。最終成果是一個可完全導航、空間連貫的 3D 環境,為 AI 影片生成奠定理想基礎。
這項研究不單是技術上的里程碑,更是一次範式轉移。它讓我們不再將構圖佈局視為事後補充,而是把它當作首要的創作工具。它是導演願景與AI驅動渲染之間的連結脈絡。
而憑藉3DTown的速度與準確度,我們最初問題的答案如今已顯而易見:沒錯——3D佈局解鎖了AI影片一直所欠缺的掌控力與一致性。
我們將這個挑戰拆解如下:
這種做法唔單止關乎視覺像真度,而係關乎創作自由。
導演而家可以直接用粗糙嘅3D預覽嚟勾勒或者鋪排一場戲。嗰個模型就成為咗畫布,AI喺上面渲染出多種視覺風格或者剪接。導演可以修改鏡頭而唔使將所有嘢重新渲染。片廠唔再需要畀錢請美術師由零開始起複雜嘅場景模型。取而代之,3DTown按需要即時創造出高質素嘅3D場景。場景喺唔同鏡頭、攝影機角度同剪接之間保持一致。呢一點令空間邏輯喺wide shot、特寫同移動攝影機之間保持完整——對敘事清晰度嚟講至關重要。
成果:3DTown如何印證此模式行之有效
在我們最近的研究中,3DTown相較於業界頂尖方法展現出顯著改進:



呢啲唔單止係學術上嘅成就,仲可以直接轉化成更順暢嘅製作流程、更少嘅修改,以及為電影工作者同創作者帶嚟更好嘅成果。
最終,我們的目標是賦能一種全新嘅工作流程,喺當中:
這就是我們將AI化為創作放大器——而非取代者——的方式。
在娛樂產業中,視覺連貫性與導演掌控至關重要,3DTown 為預覽視覺化帶來零訓練成本的解決方案。就研究及工業應用而言,它建立了一套從一開始就保留空間邏輯與視覺逼真度的製作流程。