AI驅動3D場景生成技術的進展

呢啲文章喺Utopai Studios仲叫做Cybever嘅時候發佈。隨住我哋平台不斷演變,部分內容可能已經過時,但我哋特意將呢啲文章保留喺度,作為我哋發展歷程嘅記錄。

近年來,3D場景生成領域取得了顯著突破,AI系統能夠從極少輸入創造出沉浸式世界。其中一個主流學派——以3D Gaussian Splatting等方法為代表——強調從單張圖像生成具高度幾何保真度、空間一致的3D場景。這個研究方向以World Labs等公司為代表,展示了此類方法在推進空間智能及創造更易用3D工具方面的潛力。

喺呢篇網誌入面,我哋會分析呢個創新嘅做法,並將佢同Cybever嘅方向作比較,而Cybever就專注於整合、實際應用功能同埋工業層面嘅可用性。透過探討兩者之間嘅互補性,我哋希望突顯出Cybever點樣拉近理論突破同實際落實之間嘅距離,為3D場景生成訂立新標準。

3D生成技術的重大突破

領域內近期的發展,能將單一圖像或文字轉化為3D場景,讓用戶實時探索,拉近靜態視覺與互動3D世界之間的距離。系統運用AI生成的深度圖及先進的幾何預測技術,打造出可透過網頁瀏覽器體驗的沉浸式互動。

這些系統的關鍵優勢包括:維持穩定的場景連貫性、提供無縫且動態的探索體驗、透過遵循幾何原則確保視覺一致性,以及提供互動功能,讓用戶可以調整相機設定等參數並加入視覺特效。這些能力展現出一種獨特的方式,以加強用戶與3D內容之間的互動,有望重塑整個創作流程。

分析潛在方法論及相關研究 

__wf_reserved_inherit
圖片:視覺場景生成模組。每個箭嘴代表一個參數化視覺模型(例如深度估算器)或一項操作(例如渲染)。我們全面模組化的設計,能輕易受惠於相關研究領域的進展。來源:WonderJourney: Going from Anywhere to Everywhere

根據我們的了解,此流程很可能建基於3D生成及永續視圖合成方面的尖端進展,並利用單一圖像或文字提示等極少輸入。此管道似乎運用最先進的預訓練模型(包括大型語言模型(LLMs)及視覺語言模型(VLMs))的能力,以建構及初始化3D內容。並輔以深度估算、多視圖幾何正則化及快速優化等技術,實現跨視角的一致性與準確度。高效的渲染機制似乎亦擔當關鍵角色,以提供適合實時互動的高質素輸出。

在這一範疇中值得注意的發展裡,WonderJourney [1]WonderWorld [2]論文所述的方法論提供了寶貴見解。這些方法運用條件生成技術,結合語義場景理解與穩健的3D幾何引導。預訓練的LLM及VLM不僅用於生成初始提示,亦用於反覆驗證輸出,以確保連貫性及與用戶輸入的一致性。先進的深度估算方法,例如引導式深度擴散,可應對深度不連續及遮擋錯位等挑戰,而多視圖幾何原理則有助建立場景配准及沿相機軌跡的一致性。系統採用高斯潑濺或分層圖像表示等技術,高效處理被遮擋的區域,實現快速且無縫的渲染。

這些技術進步可能包括:提升生成多樣且複雜場景類型的擴展能力、改良互動機制以容許動態效果自訂,以及進一步優化實時效能,締造無縫的使用者體驗。這類進展代表著業界頂尖技術的演進,拉近高質素生成輸出與創意及專業領域實際應用之間的距離。

挑戰

__wf_reserved_inherit
圖片:可處理單一圖像提示的方法的定性結果(放大以獲得更好檢視效果)。來源:Scene123: One Prompt to 3D Scene Generation via Video-Assisted andConsistency-Enhanced MAE(https://arxiv.org/pdf/2408.05477v2)

雖然近期嘅系統無疑令人印象深刻,但喺遊戲同電影等行業要進一步推動工業化應用,仍然有幾個機會:

  • 擴展至更大型環境:目前,生成嘅場景同可移動範圍相對較細。擴展支援更大型、更廣闊嘅環境,將可開拓更廣泛嘅應用。
  • 增強動態互動:加入動態元素同互動物件——例如跑動嘅細路、飛翔嘅雀鳥,以及變化嘅天氣狀況——可以大幅豐富用戶體驗。
  • 提升編輯功能:讓用戶透過移動或修改物件嚟改動生成場景,將可提供更大嘅創作自由度同靈活性。
  • 改善渲染質素:將視覺逼真度提升至遊戲同電影所用嘅工業級3D場景標準,將可增強系統嘅吸引力同可用性。
  • 與業界引擎整合:實現與Unreal Engine等業界標準引擎嘅兼容,將可支援先進嘅渲染、燈光同物理功能,進一步鞏固其工業相關性。

為應對這些挑戰,研究界已提出多項探索性解決方案,例如增強多視角生成、動態建模,以及先進點雲表徵 [3, 4, 5]。然而,要克服這些障礙,仍需強大的運算能力及大規模數據集。儘管存在這些難關,這項技術的潛力無可否認,並將在多個領域帶來顛覆性的應用。

Cybever的願景與技術方針

在 Cybever,我們的使命是讓創作者能夠輕鬆而精準地設計自己的 3D 世界。我們專注於與工業管道無縫整合,確保符合現實世界的物理定律,並提供最高品質的場景。我們的做法優先提供專業級環境,在各行各業中都表現卓越——從製造業、訓練數據,到遊戲、電影製作以至更多領域。透過將頂尖 AI 創新與實際應用相結合,Cybever 為 3D 創作樹立了高標準。

核心原則

  • 業界兼容性:透過與Unreal Engine及Unity等遊戲引擎整合,我們確保技術能無縫融入現有製作流程。
  • 高度自訂彈性:用戶可修改場景佈局、調整燈光,並加入動態元素,提供更大的創作自由
  • 迭代優化:我們依靠用戶的實際反饋,不斷改良我們的模型與功能。

技術路徑


在Cybever,我們的做法遵循以下原則:

  • 多模態輸入:我們的系統支援多元輸入,例如文字描述或草圖,能夠根據用戶的具體需求生成細緻的3D場景。
  • 資產驅動生成:透過運用精心策劃的高質素資產庫,我們確保一致性與自訂彈性,為創作者提供廣泛選擇,同時維持視覺與結構上的完整性。
  • 動態互動:與工業級引擎整合,讓我們能融入逼真物理效果、先進渲染技術及互動式物件動態,確保我們的輸出符合專業級應用所需。
  • 混合方法:有別於純粹以學習為基礎的系統,我們結合經典圖像技術,以及基於第一原理和幾何的佈局生成——並配以尖端機器學習模型。這種混合方式讓我們能夠平衡藝術掌控、靈活性與運算效率,同時切合專業人士及可擴展工作流程的需要。

這些原則讓Cybever得以提供一個全面且易於使用的平台, bridging the gap between creativity and functionality, 滿足各行各業創作者獨特的需要。

靈感與反思


業界整體發展方向所展示嘅技術突破,為我哋嘅工作帶嚟咗寶貴嘅啟發,突顯咗彼此喺技術路線上面嘅機遇同差異。有啲公司專注於直接從任何圖像生成3D場景,而Cybever就着重精準嘅佈局同資產配置,透過精心策劃嘅素材庫嚟確保一致性同質素。

相輔相成的3D創作旅程

共同道路

Cybever與業界其他創新者同樣抱持著普及3D創作的理念。透過降低入門門檻並優化創作流程,我們希望讓用戶能夠將意念化為栩栩如生的沉浸式虛擬世界。

獨特路向

  • 部分專注於學術創新,探索用於3D生成的尖端AI技術。
  • Cybever則着重實際應用,確保與現有工作流程及工業級應用兼容。

市場定位

雖然部分方案適合早期概念探索及學術研究,但Cybever針對嘅係需要完整專業製作流程嘅創作者。

總結

AI驅動3D生成領域的突破性成果,展現了這項技術的潛力,不斷拓展可能的界限。在Cybever,我們對這些成就深表讚賞,並將繼續致力透過產業整合及以用戶為本的創新,推動3D創作向前發展。

只要我們攜手合作,就能繼續重新定義3D創作的未來,讓任何人都能想像、設計並建構屬於自己的虛擬世界。透過結合創新、實用與協作,我們可以開拓新可能,並在各行各業激發創意。


參考資料

[1] Yu, Hong-Xing 等,〈Wonderjourney: Going from anywhere to everywhere〉,《IEEE/CVF 電腦視覺與圖形識別會議論文集》,2024年。

[2] Yu, Hong-Xing 等,〈WonderWorld: Interactive 3D Scene Generation from a Single Image〉,arXiv 預印本 arXiv:2406.09394(2024)。

[3] Chen, Yiwen, et al.「Gaussianeditor: Swift and controllable 3d editing with gaussian splatting.」Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024.

[4] Vachha, Cyrus, 及 Ayaan Haque。「Instruct-GS2GS: Editing 3D Gaussian Splats with Instructions。」2024

[5] Wang, Yuxuan 等,〈View-consistent 3d editing with gaussian splatting〉,《European Conference on Computer Vision》,Springer, Cham,2025。

閱讀更多