우리는 Utopai의 PAI를 테스트했다: 오늘날 최고의 장편 AI 비디오 생성기?

Read from

대부분의 AI 비디오 도구는 하이라이트 릴을 위해 만들어졌습니다. Sora, Kling, Luma, Runway—모두 스펙터클의 순간, 즉 소셜 미디어에서 인상적으로 보이는 눈에 띄는 5초 클립이나 시각적 실험에 최적화되어 있습니다.

그들이 거의 해결하지 못하는 것은 전문 스토리텔러에게 실제로 중요한 부분입니다: 장면 간 일관성, 컷 전반에 걸친 캐릭터 정체성, 그리고 조금이라도 어긋날 때마다 처음부터 다시 시작할 필요가 없는 세밀한 창의적 제어입니다.

그것이 Utopai Studios가 PAI로 공략하는 격차입니다. Google Research, Meta Superintelligence, Amazon AGI, Adobe Firefly 출신의 팀이 PAI를 장편 시네마틱 제작에 특화하여 구축했습니다: 단일 내러티브 흐름에서 최대 16개의 샷, 최대 1분 길이의 출력, 최대 4K 해상도를 지원합니다.

또한 보호된 IP, 저작권 있는 캐릭터, 실제 공인 초상에 대한 생성을 차단하는 내장 저작권 보호 기능이 포함되어 있어, 우발적인 침해를 감당할 수 없는 스튜디오와 전문가를 위한 기능입니다.

PAI는 이번 달 초에 공개되었습니다. 우리는 접근하여 워크플로우의 모든 단계를 살펴보았고, 그 과정에서 크레딧을 일부 잃었습니다. 전체적인 그림은 다음과 같습니다.

인터페이스

메인 화면은 ChatGPT나 일반적인 챗봇 인터페이스와 비슷합니다. 거기서 Characters, Storyboard, Video, Editor, History의 다섯 개 탭을 탐색할 수 있습니다.

하지만 이것에 속지 마십시오: PAI는 Sora나 Veo 같은 프롬프트-대기 도구가 아닙니다. 자연어 레이어가 있는 구조화된 제작 파이프라인이며, 크레딧이 걸려 있을 때 그 차이는 매우 중요합니다.

캐릭터

이것은 전체 제품군에서 가장 강력한 기능이며, 현재 어떤 AI 비디오 도구에서도 사용 가능한 가장 인상적인 캐릭터 생성 시스템일 것입니다.

사용자는 모델이 스스로 캐릭터를 생성하도록 하거나 참조 이미지를 제공하여 작업할 수 있습니다. 이것이 하는 것은 얼굴 바꾸기가 아닙니다—딥페이크 도구처럼 실제 사람의 초상을 이식하지 않습니다. 대신, 직접적인 얼굴 교체와 관련된 법적, 윤리적 문제 없이 참조와 매우 유사한 완전히 새로운 모델을 생성합니다. 모든 출력에는 SynthID 워터마크가 표시됩니다.

대부분의 AI 생성 캐릭터는 즉시 알아볼 수 있는 밀랍 같은 피부 질감을 가지고 있습니다. PAI의 캐릭터는 그렇지 않거나 적어도 같은 규모는 아닙니다. 피부 질감은 사실적으로 보이며, 빛이 얼굴에 상호작용하는 방식도 그렇고 디테일도 강합니다. 이것이 독점 모델에서 비롯되었든 비정상적으로 정교한 생성 워크플로우에서 비롯되었든 결과는 스스로 말해줍니다.

캐릭터 편집은 자연어로 이루어집니다: 저는 아내의 외모를 참조로 캐릭터를 생성했지만 결과가 너무 마른 것을 발견했습니다—그래서 모델에게 참조에 더 잘 맞도록 신체 비율을 조정해 달라고 요청했습니다. 모델은 제가 의미하는 바를 정확히 이해하고 수정했습니다.

한 가지 일관된 단점: 느립니다. 기본 캐릭터 이미지 생성조차 실행당 몇 분이 걸립니다.

스토리보드

스토리보드를 자동으로 실행하고 모델이 모든 것을 처리하도록 할 수 있지만, 그것이 만들어진 목적은 아닙니다.

PAI는 여기서 상세한 입력에 보상합니다. 더 많이 설명할수록—각 장면에서 캐릭터가 무엇을 하는지, 무엇을 말하는지, 이야기가 어떻게 진행되는지—모델이 더 잘 작동합니다. 그 구체성을 제공하면 AI가 세부 사항을 확장하고 약 12개의 키프레임을 구성합니다. 각 프레임에는 장면 이미지와 그 순간에 일어나는 일에 대한 설명(캐릭터 동작, 대화, 시각적 구성)이 포함됩니다.

커밋하기 전에 각 키프레임을 개별적으로 편집할 수 있습니다. 제어는 진정으로 세밀합니다. 만족하면 모델에게 진행하라고 지시하고, 렌더링 전에 최종 확인을 요청합니다. 이 검토-후-렌더 흐름은 현명한 설계입니다. 신중한 결정을 강제하고 비용이 많이 드는 문제가 발생하기 전에 잡아냅니다.

그렇긴 하지만, 가장 작은 편집도 시간이 걸리고 크레딧을 소모합니다. 신중하게 움직이십시오.

비디오 생성

작동할 때, 성공적인 렌더링은 1분 분량의 비디오를 생성하는 데 약 30분이 걸립니다. 출력 품질은 그 기다림을 정당화합니다. 카메라 각도는 자연스럽게 변경되며 설정된 키프레임을 존중하고, 조명은 자연스럽고, 캐릭터는 대부분의 AI 비디오 생성이 생명력 없게 만드는 텅 빈 공허한 품질이 없습니다. 목소리는 장면 전반에 걸쳐 일관되며, 다른 요소로 컷된 후에도 유지되는 적절한 억양을 가지고 있습니다.

카메라가 다른 것을 보여준 후 캐릭터에 다시 초점을 맞추면, 그들은 떠날 때와 정확히 같은 모습으로 돌아옵니다. 배경 풍경은 전체적으로 안정적으로 유지되며, 왜곡과 아티팩트가 존재하지만 미미합니다. 한 가지 약점: 모델은 비디오 내 텍스트를 잘 처리하지 못합니다. 기본적인 텍스트 요소는 생성할 수 있지만, 정확한 화면 타이포그래피가 필요한 것에는 의존하지 마십시오.

다음은 모델이 모든 것을 자동으로 처리하여 생성된 샘플입니다.

이제 더 어려운 부분입니다. 우리의 테스트 시퀀스 중 하나가 세 번 연속 실패했습니다. 첫 번째 시도는 약 45분이 걸렸고, 전체 비디오가 생성된 것처럼 크레딧을 소모했으며, 빈 결과를 생성했습니다. 우리는 챗봇에게 아무것도 생성되지 않았다고 말했습니다. 그것은 오류를 인정하고 다시 시작했습니다.

한 시간 후에도 여전히 아무것도 없었습니다. 우리는 세 번째로 시도했습니다. 같은 결과. 세 번의 시도, 상당한 크레딧 손실, 그리고 제로 푸티지. 포기할 때쯤 우리는 거의 크레딧이 바닥나서 계속 진행해야 했습니다.

실제 돈을 지불하고 전문적인 일정 내에서 작업할 때 이것은 사소한 버그가 아닙니다. 인터페이스는 오류가 발생할 수 있음을 인정합니다. 직접 경험하는 것은 다른 문제입니다. 특히 생성 과정에서 크레딧이 소모된 경우 비디오를 다운로드하려면 잔액이 양수여야 한다는 점을 고려하면 더욱 그렇습니다.

모든 것이 자동 선택된 첫 번째 테스트에서 사용자 오류가 발생했습니다: 어떤 캐릭터에 어떤 것을 사용할지 지정하지 않고 두 개의 참조 사진을 제공했고, 모델은 그것들을 반대로 할당했습니다—남성 캐릭터(저)는 여성 참조(아내)에서 생성되었고, 그 반대도 마찬가지였습니다.

여자로 변한 제 충격적인 이미지는 잊어버리세요, 결과 비디오는 여전히 제가 만든 가장 일관되게 렌더링된 장편 AI 비디오였습니다. 잘못된 참조에도 불구하고 모델은 장면에서 장면으로 시각적, 톤적 연속성을 유지했습니다. 이것은 기본 아키텍처에 대해 많은 것을 말해줍니다.

두 경험에서 얻은 교훈은 동일합니다: 일반적인 AI 비디오 도구는 모든 것을 가정하므로 많이 생각할 필요가 없지만, 그들이 결정하는 것을 받아들여야 합니다. PAI는 제어권을 제공합니다. 그리고 그 제어권과 함께 입력한 것에 대한 전적인 책임이 따릅니다.

편집기

비디오가 완성되면 Editor 탭에서 전적으로 자연어로 수정을 지시할 수 있습니다. 장면에 요소를 삽입하거나 삭제하고, 색상을 변경하고, 조명을 조정하고, 대사를 바꾸거나 립싱크를 업데이트하면 모델이 그에 따라 다시 렌더링합니다. 그것은 당신이 요청하는 것을 진정으로 이해합니다.

이것은 후처리 필터가 아닙니다. 장면 수준에서의 반복적인 AI 기반 수정입니다. 편집 의도를 설명하고 수정된 푸티지를 받는 능력은 감독과 그들의 자료 사이의 창의적 관계를 완전히 바꿉니다. 이 기능은 PAI의 다른 어떤 것보다 AI 비디오 편집이 가까운 미래에 나아갈 방향처럼 보입니다.

예를 들어, 첫 번째 비디오를 본 후 모델에게 올바른 참조를 사용하여 성별 오류를 수정하도록 요청했습니다.

처리 후, 이것에서:

이것으로:

히스토리

‍

History 탭은 모든 상호작용의 전체 타임라인을 기록합니다: 프롬프트, 편집, 렌더링 시도, 모든 것.

개인 크리에이터에게 유용한 컨텍스트를 제공합니다. 팀에게는 실제 협업 레이어가 될 수 있으며, 다른 사용자가 동료가 모델을 어떻게 지시했는지, 무엇이 효과가 있었고 무엇이 없었는지 이해하고 공유된 창의적 기록에서 계속할 수 있습니다.

가격 및 결론

PAI 가격은 10,000 크레딧에 $100입니다. 우리 테스트에서 2,000 크레딧으로 4개의 비디오(1개 완료, 3개 미완료) 총 4분을 커버했습니다—비디오당 2개의 캐릭터가 렌더 전 여러 번의 반복으로 생성되었고, 풍부하고 상세한 프롬프트로 스토리보드 개발, 렌더 후 편집 약 2회가 포함되었습니다.

전반적으로 PAI는 AI 비디오를 진지하게 받아들이는 사람들을 위해 만들어진 전문 도구처럼 느껴집니다. 느리고, 경험 부족에 대해 용서하지 않으며—솔직히 좋은 튜토리얼이 필요할 수 있습니다—예산을 매우 빠르게 소모할 수 있습니다. 인터페이스는 실패에 완벽하게 안전하지 않으며, 준비 없이 들어가면 시스템이 당신을 벌할 것입니다.

그것이 어떻게 생각하는지 배우는 첫 세션 후, 두 번째 테스트 라운드는 매우 놀랍고 만족스러운 결과를 생성했습니다—일반적으로 얼굴 바꾸기 기술, 시행착오, 후반 편집이 필요한 종류입니다.

연속성, IP 안전, 시네마틱 품질이 타협할 수 없는 요소인 전문 비디오 크리에이터에게 PAI는 현재 사용 가능한 최고의 장편 AI 비디오 시스템입니다. 신뢰성 문제를 해결한다면, 적어도 지금으로서는 다른 어떤 것도 근접하지 않습니다.

Read more