TeDiO:用于免训练连贯视频扩散的时间对角优化
计算机视觉与模式识别
2026-05-15 v1
摘要
近期的文本到视频扩散 Transformer 能够生成视觉上引人注目的帧,但在时间连贯性方面仍然存在困难,经常产生闪烁、漂移或不稳定的运动。我们表明,这些失败在模型内部留下了清晰的印记:不连贯的视频在其中间自注意力图中始终表现出不规则、碎片化的时间对角线,而稳定的运动则对应于平滑的带状对角线模式。基于这一观察,我们引入了 TeDiO,这是一种免训练的推理时方法,通过对这些内部注意力模式进行正则化来增强时间一致性。TeDiO 估计对角线平滑度,识别不稳定区域,并执行轻量级的潜在更新以促进连贯的逐帧动态,而无需修改模型权重或使用外部运动监督。在多个视频扩散模型(例如 Wan2.1、CogVideoX)上,TeDiO 提供了明显更平滑的运动,同时保持了每帧的视觉质量,为改善现代视频生成系统中的动态真实性提供了一种高效的即插即用方法。
引用
@article{arxiv.2605.14136,
title = {TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion},
author = {Nurislam Tursynbek and Zhiqiang Lao and Heather Yu and Gedas Bertasius and Marc Niethammer},
journal= {arXiv preprint arXiv:2605.14136},
year = {2026}
}
备注
CVPR'26 Workshop on Agentic AI for Visual Media