中文

潜在时间差异作为运动先验:面向T2V动态保真度的损失加权策略

计算机视觉与模式识别 2026-01-29 v1

摘要

视频生成模型在静态场景中取得了显著进展,但在运动视频生成方面表现有限,在剧烈动态变化时质量会下降。这源于噪声破坏了时间一致性,增加了学习动态区域的难度。{不幸的是,现有的扩散模型在所有场景中都使用静态损失,限制了其捕捉复杂动态的能力。}为此,我们引入潜在时间差异 (Latent Temporal Discrepancy, LTD) 作为运动先验以指导损失加权。LTD 测量潜在空间中帧间的变化,为动态区域分配更大的惩罚,同时保持稳定区域的常规优化。这种运动感知的策略稳定了训练,使模型能够更好地重建高频动态。在通用基准 VBench 和面向运动的 VMBench 上进行大量实验,结果一致显示提升,其中本方法在 VBench 上超越强基线提升 3.31%,在 VMBench 上提升 3.58%,显著改善了运动质量。

关键词

引用

@article{arxiv.2601.20504,
  title  = {Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V},
  author = {Meiqi Wu and Bingze Song and Ruimin Lin and Chen Zhu and Xiaokun Feng and Jiahong Wu and Xiangxiang Chu and Kaiqi Huang},
  journal= {arXiv preprint arXiv:2601.20504},
  year   = {2026}
}

备注

Accepted by ICASSP 2026