中文

基于压缩域运动向量的生成视频时序真实性评估

计算机视觉与模式识别 2025-11-19 v1

摘要

时序真实性仍是当前生成视频模型的核心弱点,因为大多数评估指标侧重于空间外观,仅能对运动提供有限的灵敏度。我们引入一种可扩展且模型无关的框架,通过直接从压缩视频流中提取运动向量(Motion Vectors, MVs)来评估时序行为。H.264 和 HEVC 等标准生成的 MVs 提供了轻量级、分辨率一致的运动动态描述符。我们通过计算实视频和生成视频中 MVs 统计信息之间的 Kullback-Leibler 散度、Jensen-Shannon 散度和 Wasserstein 散度来量化真实性。在包含来自八个最先进生成器视频的 GenVidBench 数据集上的实验揭示了与真实运动相比,系统性的差异:基于熵的散度将 Pika 和 SVD 排名最接近真实视频,MV-求和统计数据则偏好 VC2 和 Text2Video-Zero,而 CogVideo 在两种措施上均显示最大偏差。MVs 场和类别条件运动热图的可视化进一步揭示了中心偏置、稀疏和分段恒定流,以及帧级指标无法捕捉的网格状瑕疵。除了评估之外,我们还研究了 MVs 与 RGB 通道的融合,包括通道拼接、交叉注意力、联合嵌入和一种运动感知融合模块。将 MVs 纳入后,下游分类在 ResNet、I3D 和 TSN 各类骨干网络中均取得改善,ResNet-18 和 ResNet-34 在真实视频与生成视频的判别中分别达到最高可达 97.4% 和 99.0% 的准确率。这些发现表明,压缩域 MVs 为诊断生成视频中的运动缺陷以及加强判别模型中的时序推理提供了有效的时序信号。实现代码已提供:[链接](https://github.com/KurbanIntelligenceLab/Motion-Vector-Learning)。

关键词

引用

@article{arxiv.2511.13897,
  title  = {Temporal Realism Evaluation of Generated Videos Using Compressed-Domain Motion Vectors},
  author = {Mert Onur Cakiroglu and Idil Bilge Altun and Zhihe Lu and Mehmet Dalkilic and Hasan Kurban},
  journal= {arXiv preprint arXiv:2511.13897},
  year   = {2025}
}