用于鲁棒文本到视频生成的潜在视频扩散模型的腐败感知训练
计算机视觉与模式识别
2026-03-31 v4 机器学习
摘要
潜在视频扩散模型(LVDMs)在图像和视频生成方面实现了最先进的生成质量;然而,它们在噪声条件下仍然脆弱,文本或多模态嵌入中的微小扰动会在时间步上级联并导致语义漂移。图像扩散中现有的腐败策略(高斯、均匀)在视频环境中失效,因为静态噪声会破坏时间保真度。在本文中,我们提出了CAT-LVDM,一种具有专为视频扩散定制的结构化、数据对齐噪声注入的腐败感知训练框架。我们的两个算子,批中心噪声注入(BCNI)和频谱感知上下文噪声(SACN),将扰动与批语义或频谱动态对齐以保持连贯性。CAT-LVDM产生了实质性的收益:BCNI在WebVid-2M、MSR-VTT和MSVD上将FVD降低了31.9%,而SACN将UCF-101提升了12.3%,尽管在少于5倍数据上训练,仍优于高斯、均匀甚至大型扩散基线如DEMO(2.3B)和Lavie(3B)。消融实验证实了低秩、数据对齐噪声的独特价值,理论则确立了这些算子为何能收紧鲁棒性和泛化界限。因此,CAT-LVDM为鲁棒视频扩散建立了一个新框架,我们的实验表明它也可以扩展到自回归生成和多模态视频理解LLM。代码、模型和样本可在https://github.com/chikap421/catlvdm获取。
引用
@article{arxiv.2505.21545,
title = {Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation},
author = {Chika Maduabuchi and Hao Chen and Yujin Han and Jindong Wang},
journal= {arXiv preprint arXiv:2505.21545},
year = {2026}
}
备注
ICLR 2026 ReALM-GEN