多事件视频生成中事件何时何处切换?
计算机视觉与模式识别
2025-10-06 v1 人工智能
摘要
文本到视频(T2V)生成因描绘多事件序列具有时序一致性和可控内容的挑战性而迅速增长。现有方法在延伸至多事件生成时,忽略了事件切换中的内在因素。本文旨在回答核心问题:多事件提示在 T2V 生成过程中控制事件转换的时机与位置。本工作引入 MEve,一个自 curated 的提示套件,用于评估多事件文本到视频(T2V)生成,并对两大代表性模型族(即 OpenSora 和 CogVideoX)进行系统性研究。大量实验表明,去噪步骤和块状模型层的早期干预至关重要,揭示了多事件视频生成的关键因素,并凸显了未来模型中多事件条件化的可能性。
引用
@article{arxiv.2510.03049,
title = {When and Where do Events Switch in Multi-Event Video Generation?},
author = {Ruotong Liao and Guowen Huang and Qing Cheng and Thomas Seidl and Daniel Cremers and Volker Tresp},
journal= {arXiv preprint arXiv:2510.03049},
year = {2025}
}
备注
Work in Progress. Accepted to ICCV2025 @ LongVid-Foundations