我們實測Utopai的PAI:目前最佳長篇AI影片生成工具?

閱讀自

大部分AI影片工具都係為咗個精華片段而設。SoraKling、Luma、Runway——全部都係為咗嗰一刻嘅視覺奇觀而優化:一條搶眼嘅五秒片、一個喺社交媒體上好睇得吓嘅視覺實驗。

佢哋好少能夠解決嘅,正正就係專業敘事者最着緊嘅部分:場與場之間嘅一致性、剪接之間嘅角色身份連貫,以及唔使每次稍為有偏差就要由頭再做過嘅細緻創作掌控。

這就是Utopai Studios藉著PAI要填補的缺口。其團隊來自Google Research、Meta Superintelligence、Amazon AGI及Adobe Firefly,專為長篇電影製作而打造PAI:單一敘事流程內最多可生成16個鏡頭,輸出長度可達一分鐘,解像度最高達4K。

它亦內置版權保護功能,禁止生成受保護知識產權、受版權保護角色及真實公眾人物肖像——此功能專為無法承受意外侵權的製作公司及專業人士而設。

PAI喺今個月頭先至正式開放畀公眾使用。我哋入咗去,逐個工作流程階段都試過,仲用咗唔少credits。以下就係完整情況。

介面

主畫面看起來就像ChatGPT或任何典型嘅聊天機械人介面。喺嗰度,你可以瀏覽五個分頁:角色、分鏡、影片、剪輯同歷史記錄。

但千祈唔好俾呢點呃到:PAI 並唔係好似 Sora 或 Veo 咁嘅「打提示、等結果」工具。佢係一套結構化嘅製作流程,上面再加一層自然語言介面,而呢個分別——當涉及到掛名嘅時候——就非常重要。

角色

這是整個套件中最強勁的功能,亦可能是目前任何AI影片工具中最令人驚豔的角色生成系統。

用戶可以選擇讓模型自行創作角色,或者輸入參考圖片作為生成依據。它所做的並非換臉——不會像深偽工具那樣移植真實人物的容貌。取而代之,它會生成與參考極為接近的全新模型,同時避開直接替換臉孔所帶來的法律及道德問題。所有輸出均會加上SynthID水印。

大部分AI生成嘅角色都有種蠟燭般嘅皮膚質感,一眼就畀人睇穿。PAI嘅就冇呢個問題,或者至少冇咁嚴重。皮膚紋理睇落好真實,光線同面部嘅互動方式亦然,細節亦好紮實。無論呢個係嚟自專有模型,定係一套異常精煉嘅生成流程,出嚟嘅效果本身就說明一切。

角色編輯係透過自然語言進行:我參考咗老婆嘅外貌生成咗一個角色,但發現出嚟嘅效果瘦得滯——所以我叫個模型調整身形比例,令佢更貼近參考。佢完全明白我嘅意思,仲修正咗。

唯一不變嘅前提係:佢好慢。即使係基本嘅角色圖像生成,每次都要幾分鐘。

故事板

你可以用自動模式運行故事板,由模型幫你搞掂一切,但呢個並唔係佢原本嘅設計用途。

PAI 在此獎勵詳細嘅輸入。你解釋得越詳細——每個場景入面角色做啲乜、佢哋講啲乜、故事點樣推進——個模型就運作得越好。畀佢呢種具體細節,佢就會用 AI 去擴展啲細節,然後圍繞住構建大約十二個關鍵影格。每個影格都會附有一張場景圖像,同埋嗰一刻發生緊咩事嘅描述:角色動作、對白同視覺構圖。

你可以逐個關鍵影格獨立編輯,之後先至落實任何嘢。個控制真係細緻到極。當你滿意之後,就同個模型講可以繼續,而佢喺渲染之前會要求你最後確認一次。呢個「先審閱、後渲染」嘅流程係聰明嘅設計。佢迫使你作出審慎嘅決定,喺問題未變成昂貴嘅代價之前就捉到出嚟。

話雖如此,即使係最細嘅修改都要時間同消耗積分。審慎行事。

影片生成

成功嘅話,一次渲染大約需要30分鐘先可以生成到一分鐘完整影片。出嚟嘅質素絕對值得等。鏡頭角度轉換自然,而且會跟返已設定嘅關鍵影格,燈光自然,角色亦冇嗰種空洞、呆滯嘅感覺——而正正係呢種感覺令大部分AI生成影片睇落死氣沉沉。角色聲線喺唔同場景之間保持一致,語調準確,即使剪接去其他元素之後都依然維持到。

當鏡頭喺展示其他嘢之後重新對焦返喺角色身上,佢哋返嚟嗰陣同離開嗰陣一模一樣。背景景色全程保持穩定,雖然會有扭曲同瑕疵,但都只係輕微。一個弱點:呢個模型處理影片內文字嘅表現麻麻。佢可以生成基本嘅文字元素,但如果需要精準嘅螢幕字體排版,就唔好倚賴佢。

以下是一個由模型全自動處理所生成嘅樣本。

而家到最難嘅部分。我哋其中一段測試序列連續三次失敗。第一次嘗試用咗大約45分鐘,消耗咗等同生成完整影片嘅額度,但出嚟嘅結果係空白。我哋同聊天機械人講,佢根本冇生成到任何嘢。佢承認出錯,然後重新開始。

一個鐘之後,依然冇任何反應。我哋再試咗第三次,結果一樣。三次嘗試,消耗咗大量點數,但一條片都出唔到。到我哋放棄嗰陣,點數幾乎用晒,唯有繼續做落去。

當你俾真金白銀、又要趕專業時間表嘅時候,呢個絕對唔係小問題。介面本身都承認錯誤係會發生嘅,但親身遇到就係另一回事,尤其係如果你嘅點數喺生成過程中用咗,你就要有正數結餘先至可以下載條片。

喺我哋第一次測試、全部自動揀選嘅時候,我犯咗個用戶錯誤:我餵咗兩張參考照片但冇指定邊個角色應該用邊張,而個模型就掉轉咗嚟分配——男性角色(我)係用女性參考(我太太)生成,反之亦然。

唔好再記住我變成女人嗰個嚇人畫面,而條片出到嚟,始終都係我製作過最穩定連貫嘅長篇AI影片。即使參考資料用錯咗,個模型喺場景與場景之間仍然保持到視覺同調性上嘅連貫。呢點好說明到佢底層架構嘅實力。

兩次經驗帶出同一個教訓:普通AI影片工具乜都幫你假設好,即係你唔使點諗——但同時你亦要接受佢哋決定嘅一切。PAI就畀你話事權。而隨住呢個話事權而嚟嘅,就係你對自己輸入嘅內容負上全部責任。

剪接師

影片完成之後,「Editor」分頁讓你完全用自然語言指示修改。你可以喺場景入面加入元素、刪除元素、改顏色、調較燈光、改對白措辭,或者更新嘴形同步,模型就會相應重新渲染。它真係明白你講緊乜。

呢個並唔係後期處理濾鏡,而係以場景為單位、由AI驅動嘅迭代式修改。可以描述剪接意圖,然後收到相應修正過嘅片段,呢種能力徹底改變咗導演同素材之間嘅創作關係。呢項功能,比PAI入面任何其他嘢都更能反映AI影片剪輯喺不久將來可能走向嘅方向。

例如,睇完第一條片之後,我叫個模型用正確嘅參考資料去修正嗰個性別稱謂錯誤。

處理過後,佢由噉樣:

改為這樣:

歷史

「歷史」分頁會記錄每一次互動的完整時間線:提示、編輯、渲染嘗試,全部都有。

對個人創作者嚟講,呢個功能提供咗實用嘅背景資訊。對團隊而言,佢可能係一個真正嘅協作平台,唔同用戶可以睇到同事點樣引導個模型,了解邊啲做法行得通、邊啲唔得,並且喺共享嘅創作記錄上繼續發展。

定價與盈利底線

PAI嘅定價係100美元換10,000個credits。喺我哋嘅測試入面,2,000個credits應付咗四條片(一條完成、三條未完成),總共四分鐘——每條片生成兩個角色,render之前經過多次迭代,用豐富而詳細嘅prompt開發storyboard,另外仲有大約兩輪render後剪輯。

整體而言,PAI 感覺係一款專為真正認真看待 AI 影片製作嘅人而設嘅專業工具。佢運作慢、對新手毫不留情——老實講真係好需要一個好嘅教學——而且可以極快咁燒乾你嘅預算。介面並非萬無一失,如果你準備不足,系統一定會令你付出代價。

經過第一節課了解佢點樣思考之後,我哋第二輪測試得出咗非常驚喜同令人滿意嘅結果——呢種效果通常要靠換臉技術、反覆試錯,再喺後期剪接先做到。

對於專業影片創作者嚟講,連貫性、IP安全同電影級質素都係不可或缺嘅元素,而PAI係目前最出色嘅長篇AI影片系統。只要解決咗可靠性問題,暫時嚟講,其他方案都遠遠比唔上。

閱讀更多