视频扩散模型中的早期失效检测与干预
计算机视觉与模式识别
2026-03-17 v1
摘要
文本到视频(T2V)扩散模型取得了快速进展,但生成的视频仍偶尔在实际中失败,如文本视频对齐度或感知质量较差。由于扩散采样是非确定性的,在推理过程中难以判断生成是否会成功,从而因试错式再生而产生高计算成本。为此,本文提出一种面向潜在 T2V 扩散模型的早期失效检测与诊断干预管道。对于检测,我们设计了实时检查(RI)模块,将潜在表示转换为中间视频预览, enables 使用已建立的文本视频对齐评分器在 RGB 空间中进行检查。RI 模块仅用 39.2ms 完成转换和检查,考虑到 CogVideoX-5B 在 NVIDIA A100 GPU 上生成 480p、49 帧视频每个去噪步骤需要 4.3s,此效率极高。随后,我们仅在预测失败时触发层次化的早期退出干预管道。CogVideoX-5B 和 Wan2.1-1.3B 上的实验表明,我们的方法在 VBench 上实现一致性提升,相对于事后再生的时间开销降低最高 2.64 倍。我们的方法也适用于更高容量的设置,在 Wan2.1-14B 上处理 720p 分辨率、81 帧的生成仍然有效。此外,我们的管道是即插即用的,且与现有技术正交,显示与提示优化和采样引导方法的无缝兼容性。我们还提供了失效信号在去噪过程中早期出现且可被标准视觉语言评估器在中间视频预览中检测到的证据。
引用
@article{arxiv.2603.14320,
title = {Early Failure Detection and Intervention in Video Diffusion Models},
author = {Kwon Byung-Ki and Sohwi Lim and Nam Hyeon-Woo and Moon Ye-Bin and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2603.14320},
year = {2026}
}
备注
29 pages, 24 figures, 9 tables