
呢啲文章發表嗰陣,Utopai Studios 仲叫做 Cybever。隨住我哋平台不斷發展,部分內容或者已經過時,但我哋特登將呢啲文章保留喺度,作為我哋發展歷程嘅記錄。
近年在3D場景生成領域出現了顯著突破,AI系統能夠以極少輸入創造出沉浸式世界。一個備受注目的學派——以3D Gaussian Splatting等方法為代表——強調從單一圖像生成空間一致、幾何保真度高的3D場景。這個研究方向由World Labs等公司引領,展示了此類方法在推進空間智能及打造更易用的3D工具方面的潛力。
喺呢篇網誌入面,我哋會分析呢個創新嘅做法,並將佢同Cybever嘅方向作比較,而Cybever就專注於整合、實際功能同埋工業應用性。透過探討兩者嘅互補性,我哋希望突顯Cybever點樣喺理論突破同實際落實之間搭建橋樑,為3D場景生成訂立新標準。
近期的技術發展可將單一圖像或文字轉化為3D場景,讓用戶實時探索,拉近靜態視覺與互動3D世界之間的距離。此系統運用AI生成的深度圖及先進的幾何預測技術,打造出可透過網頁瀏覽器體驗的沉浸式互動。
這些系統的主要優勢包括:維持穩定的場景連貫性、提供無縫且動態的探索體驗、透過遵循幾何原則確保視覺一致性,以及提供互動功能,讓用戶可以調整鏡頭設定等參數並加入視覺特效。這些能力展現了一種獨特的方式去提升用戶與3D內容的互動,有望重塑整個創作流程。

根據我哋嘅理解,呢個流程好可能建基於3D生成同永續視角合成嘅尖端技術,只需極少輸入,例如單張圖像或文字提示。呢條pipeline似乎運用咗最先進嘅預訓練模型,包括大型語言模型(LLMs)同視覺語言模型(VLMs),去建構同初始化3D內容。再配合深度估算、多視角幾何正則化同快速優化等技術,令到唔同視角之間保持一致同準確。高效嘅渲染機制亦似乎擔當關鍵角色,提供適合實時互動嘅高質素輸出。
在這一領域值得注意的發展之中,WonderJourney [1] 及 WonderWorld [2] 論文所述的方法提供了寶貴的見解。這些方法運用條件生成技術,將語義場景理解與穩健的3D幾何引導結合起來。預先訓練的LLM及VLM不僅用於生成初始提示,亦用於反覆驗證輸出,以確保連貫性以及與用戶輸入的一致性。進階的深度估算方法,例如引導式深度擴散,可應對深度不連續及遮擋錯位等挑戰,而多視角幾何原理則有助建立場景配準,並沿相機軌跡保持一致性。諸如高斯潑濺或分層圖像表示等技術則用於有效處理被遮擋的區域,實現快速且無縫的渲染。
這些技術進展可能包括提升可擴展性,以生成多樣且複雜的場景類型;改良互動機制,讓用戶可動態自訂效果;以及進一步優化實時效能,帶來流暢無縫的使用體驗。這類進展代表著業界頂尖技術的演進,拉近了高品質生成輸出與創意及專業領域實際應用之間的距離。

雖然近期嘅系統無疑令人印象深刻,但喺遊戲同電影等行業要進一步推動其工業化應用,仍有幾個機會:
為應對這些挑戰,學界已提出多項探索性解決方案,例如增強的多視角生成、動態建模,以及更先進的點雲表示法 [3, 4, 5]。然而,要克服這些障礙,仍需龐大的運算能力及大規模數據集。儘管面對重重難關,這項技術的潛力毋庸置疑,其變革性應用將遍及多個領域。
在Cybever,我們的使命是讓創作者能夠輕鬆而精準地設計屬於自己的3D世界。我們專注於與工業級製作流程無縫整合,確保符合現實世界的物理法則,並呈獻最高質素的場景。我們的方針以提供專業級環境為先,在各行各業中表現卓越——從製造業、訓練數據,到遊戲、電影製作,以至更廣泛的領域。憑藉將尖端AI創新與實際應用相結合,Cybever為3D創作訂立了高標準。
在Cybever,我們的做法以以下原則為依歸:
這些原則讓Cybever得以提供一個全面且易用的平台, bridging the gap between creativity and functionality,滿足各行各業創作者獨特的需求。
業界整體發展方向所展示的技術進展,為我們的工作帶來寶貴啟發,亦突顯了我們各自技術路向的機遇與差異。部分方案聚焦於直接從任何圖像生成3D場景,而Cybever則着重精準的佈局與資產配置,並借助精心策劃的素材庫,確保一致性與質素。
Cybever與業界其他創新者同樣抱持一個願景:讓3D創作普及化。透過降低入門門檻並提升創作流程,我們期望賦予用戶能力,將他們的構思化為豐富而沉浸的虛擬世界。
雖然部分方案適合早期概念探索及學術研究,但Cybever針對嘅係需要完整工作流程作專業製作嘅創作者。
AI驅動3D生成領域的突破性成果,展現了這項技術的潛力,不斷拓展可能的界限。在Cybever,我們對這些成就表示讚賞,並繼續致力透過產業整合及用戶驅動的創新,推動3D創作發展。
齊心協力,我們可以繼續重新定義3D創作的未來,讓任何人都能夠想像、設計及建構屬於自己的虛擬世界。透過結合創新、實用性與協作,我們可以開拓新的可能性,並激發跨行業的創意。
參考資料
[1] Yu, Hong-Xing, et al. 「Wonderjourney: Going from anywhere to everywhere.」 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024.
[2] 余鴻興等,「WonderWorld: Interactive 3D Scene Generation from a Single Image」,arXiv 預印本 arXiv:2406.09394(2024年)。
[3] Chen, Yiwen, et al.「Gaussianeditor: Swift and controllable 3d editing with gaussian splatting.」Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024.
[4] Vachha, Cyrus, and Ayaan Haque. 「Instruct-GS2GS: Editing 3D Gaussian Splats with Instructions.」 2024
[5] Wang, Yuxuan, et al.「View-consistent 3d editing with gaussian splatting.」European Conference on Computer Vision. Springer, Cham, 2025.