
呢啲文章發表嗰陣,Utopai Studios 仲叫做 Cybever。隨住我哋平台不斷發展,部分內容或者已經過時,但我哋特登將呢啲文章保留喺度,作為我哋發展歷程嘅記錄。
AI 影片生成嘅前景確實令人期待。圖像識自己動起嚟、場景自動構建、故仔由一段文字提示生成。但任何試過生成長篇內容或者多鏡頭場景嘅人都清楚知道目前嘅限制:幾何結構會漂移、畫面之間視覺唔一致,仲有整體上缺乏導演掌控。
呢啲問題唔止係技術上嘅麻煩,仲係創作上嘅致命傷。
正因如此,Cybever 相信解決方案在於結構——具體嚟講,就係 3D 佈局。
我們問自己一個簡單嘅問題:3D場景係咪可以為AI生成影片迫切所需嘅一致性同控制力帶嚟答案?
為咗解答呢個問題,我哋嘅研究團隊開發咗3DTown,一個能夠從單張俯視圖像生成完整3D城鎮景觀嘅嶄新系統。呢項研究最近喺arXiv發表,引入咗一套強大嘅方法,可以從單一2D輸入建構出細節豐富、語義準確嘅3D環境。
3DTown 並非依賴耗費大量人力的手動建模,而是運用 AI 去解讀空間關係,建構出完整的 3D 場景,當中包含道路、建築物及其他環境結構,同時保持視覺逼真度與幾何一致性。最終成果是一個可全面導航、空間連貫的 3D 環境,為 AI 影片生成奠定理想基礎。
呢項研究唔單止係技術上嘅里程碑,而係一次範式轉移。佢讓我哋可以將構圖佈局唔再當係事後諗嘅嘢,而係視為一等一嘅創作工具。佢就係導演視野同AI驅動渲染之間嘅連結組織。
而憑住3DTown嘅速度同準確度,我哋最初嗰條問題嘅答案而家已經好清楚:係——3D佈局解鎖咗AI影片一直缺失嘅控制力同一致性。
以下係我哋點樣拆解呢個挑戰:
呢個做法唔單止係為咗視覺上嘅逼真,而係為咗創作自由。
導演而家可以用粗略嘅3D預覽嚟勾勒或規劃場景。呢個模型就成為畫布,AI喺上面渲染出多種視覺風格或剪輯。導演可以修改鏡頭,唔使重新渲染全部嘢。片廠唔再需要畀錢請美術師由零開始砌複雜場景。取而代之,3DTown可以按需要即時生成高質素3D場景。場景喺唔同鏡頭、攝影角度同剪輯之間保持一致。咁樣可以喺wide shot、特寫同移動鏡頭之間保住空間邏輯——對敘事清晰度嚟講至關重要。
成果:3DTown如何證明此模式行之有效
在我們近期的研究中,3DTown相較於業界最新方法展現出顯著嘅改進:



呢啲唔單止係學術上嘅勝利,仲可以直接轉化為更順暢嘅製作流程、更少嘅修改,以及為電影工作者同創作者帶嚟更好嘅成果。
歸根究柢,我們的目標是賦能一種全新嘅工作流程,喺當中:
這就是我們如何將 AI 變成創作放大器——而非取代品。
在影視娛樂行業,視覺連貫性與導演掌控至關重要,3DTown 為預視覺化帶來零培訓成本的解決方案。針對研究及工業應用,它建立了一套流程,讓空間邏輯與視覺保真度從一開始就得以保留。