
呢啲文章喺Utopai Studios仲叫做Cybever嘅時候發佈。隨住我哋平台不斷演變,部分內容可能已經過時,但我哋特意將呢啲文章保留喺度,作為我哋發展歷程嘅記錄。
近年來,3D場景生成領域取得了顯著突破,AI系統能夠從極少輸入創造出沉浸式世界。其中一個主流學派——以3D Gaussian Splatting等方法為代表——強調從單張圖像生成具高度幾何保真度、空間一致的3D場景。這個研究方向以World Labs等公司為代表,展示了此類方法在推進空間智能及創造更易用3D工具方面的潛力。
喺呢篇網誌入面,我哋會分析呢個創新嘅做法,並將佢同Cybever嘅方向作比較,而Cybever就專注於整合、實際應用功能同埋工業層面嘅可用性。透過探討兩者之間嘅互補性,我哋希望突顯出Cybever點樣拉近理論突破同實際落實之間嘅距離,為3D場景生成訂立新標準。
領域內近期的發展,能將單一圖像或文字轉化為3D場景,讓用戶實時探索,拉近靜態視覺與互動3D世界之間的距離。系統運用AI生成的深度圖及先進的幾何預測技術,打造出可透過網頁瀏覽器體驗的沉浸式互動。
這些系統的關鍵優勢包括:維持穩定的場景連貫性、提供無縫且動態的探索體驗、透過遵循幾何原則確保視覺一致性,以及提供互動功能,讓用戶可以調整相機設定等參數並加入視覺特效。這些能力展現出一種獨特的方式,以加強用戶與3D內容之間的互動,有望重塑整個創作流程。

根據我們的了解,此流程很可能建基於3D生成及永續視圖合成方面的尖端進展,並利用單一圖像或文字提示等極少輸入。此管道似乎運用最先進的預訓練模型(包括大型語言模型(LLMs)及視覺語言模型(VLMs))的能力,以建構及初始化3D內容。並輔以深度估算、多視圖幾何正則化及快速優化等技術,實現跨視角的一致性與準確度。高效的渲染機制似乎亦擔當關鍵角色,以提供適合實時互動的高質素輸出。
在這一範疇中值得注意的發展裡,WonderJourney [1]及WonderWorld [2]論文所述的方法論提供了寶貴見解。這些方法運用條件生成技術,結合語義場景理解與穩健的3D幾何引導。預訓練的LLM及VLM不僅用於生成初始提示,亦用於反覆驗證輸出,以確保連貫性及與用戶輸入的一致性。先進的深度估算方法,例如引導式深度擴散,可應對深度不連續及遮擋錯位等挑戰,而多視圖幾何原理則有助建立場景配准及沿相機軌跡的一致性。系統採用高斯潑濺或分層圖像表示等技術,高效處理被遮擋的區域,實現快速且無縫的渲染。
這些技術進步可能包括:提升生成多樣且複雜場景類型的擴展能力、改良互動機制以容許動態效果自訂,以及進一步優化實時效能,締造無縫的使用者體驗。這類進展代表著業界頂尖技術的演進,拉近高質素生成輸出與創意及專業領域實際應用之間的距離。

雖然近期嘅系統無疑令人印象深刻,但喺遊戲同電影等行業要進一步推動工業化應用,仍然有幾個機會:
為應對這些挑戰,研究界已提出多項探索性解決方案,例如增強多視角生成、動態建模,以及先進點雲表徵 [3, 4, 5]。然而,要克服這些障礙,仍需強大的運算能力及大規模數據集。儘管存在這些難關,這項技術的潛力無可否認,並將在多個領域帶來顛覆性的應用。
在 Cybever,我們的使命是讓創作者能夠輕鬆而精準地設計自己的 3D 世界。我們專注於與工業管道無縫整合,確保符合現實世界的物理定律,並提供最高品質的場景。我們的做法優先提供專業級環境,在各行各業中都表現卓越——從製造業、訓練數據,到遊戲、電影製作以至更多領域。透過將頂尖 AI 創新與實際應用相結合,Cybever 為 3D 創作樹立了高標準。
在Cybever,我們的做法遵循以下原則:
這些原則讓Cybever得以提供一個全面且易於使用的平台, bridging the gap between creativity and functionality, 滿足各行各業創作者獨特的需要。
業界整體發展方向所展示嘅技術突破,為我哋嘅工作帶嚟咗寶貴嘅啟發,突顯咗彼此喺技術路線上面嘅機遇同差異。有啲公司專注於直接從任何圖像生成3D場景,而Cybever就着重精準嘅佈局同資產配置,透過精心策劃嘅素材庫嚟確保一致性同質素。
Cybever與業界其他創新者同樣抱持著普及3D創作的理念。透過降低入門門檻並優化創作流程,我們希望讓用戶能夠將意念化為栩栩如生的沉浸式虛擬世界。
雖然部分方案適合早期概念探索及學術研究,但Cybever針對嘅係需要完整專業製作流程嘅創作者。
AI驅動3D生成領域的突破性成果,展現了這項技術的潛力,不斷拓展可能的界限。在Cybever,我們對這些成就深表讚賞,並將繼續致力透過產業整合及以用戶為本的創新,推動3D創作向前發展。
只要我們攜手合作,就能繼續重新定義3D創作的未來,讓任何人都能想像、設計並建構屬於自己的虛擬世界。透過結合創新、實用與協作,我們可以開拓新可能,並在各行各業激發創意。
參考資料
[1] Yu, Hong-Xing 等,〈Wonderjourney: Going from anywhere to everywhere〉,《IEEE/CVF 電腦視覺與圖形識別會議論文集》,2024年。
[2] Yu, Hong-Xing 等,〈WonderWorld: Interactive 3D Scene Generation from a Single Image〉,arXiv 預印本 arXiv:2406.09394(2024)。
[3] Chen, Yiwen, et al.「Gaussianeditor: Swift and controllable 3d editing with gaussian splatting.」Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024.
[4] Vachha, Cyrus, 及 Ayaan Haque。「Instruct-GS2GS: Editing 3D Gaussian Splats with Instructions。」2024
[5] Wang, Yuxuan 等,〈View-consistent 3d editing with gaussian splatting〉,《European Conference on Computer Vision》,Springer, Cham,2025。