LongVie: 多模态引导的可控超长视频生成
计算机视觉与模式识别
2025-08-06 v1
摘要
可控的超长视频生成是一项基本且具有挑战性的任务。虽然现有方法对短片有效,但在面对诸如时序不一致和视觉退化等问题时难以扩展。本文我们初步调查并识别了三个关键因素:独立的噪声初始化、独立的控制信号归一化,以及单模态引导的局限性。为此,我们提出了 LongVie,一个面向可控长视频生成的端到端自回归框架。LongVie 引入了两个核心设计以确保时序一致性:1) 统一的噪声初始化策略,确保跨片段的一致生成;2) 全局控制信号归一化,确保整个视频在控制空间中的对齐。为缓解视觉退化,LongVie 采用 3) 多模态控制框架,将稠密(例如深度图)和稀疏(例如关键点)控制信号相结合,补以 4) 一种降解感知的训练策略,随时间自适应平衡模态贡献以保持视觉质量。我们还引入了 LongVGenBench,一个包含 100 个高分辨率视频的综合基准,涵盖多样化的真实世界和合成环境,每个视频时长超过一分钟。广泛的实验表明,LongVie 在长程可控性、一致性和质量方面实现了最先进的性能。
引用
@article{arxiv.2508.03694,
title = {LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation},
author = {Jianxiong Gao and Zhaoxi Chen and Xian Liu and Jianfeng Feng and Chenyang Si and Yanwei Fu and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2508.03694},
year = {2025}
}
备注
Project page: https://vchitect.github.io/LongVie-project/