生成式动作指纹:评估合成视频中的人类动作
计算机视觉与模式识别
2025-12-04 v2
摘要
尽管视频生成模型取得了快速进展,但用于评估复杂人类动作视觉与时间正确性的鲁棒指标仍显得含糊。严重的是,现有的纯视觉编码器和多模态大语言模型(MLLM)高度偏向外观,缺乏时间理解,因而难以辨别生成视频中复杂的运动动力学和解剖不合理性。我们通过引入源自真实世界人类动作学习型潜在空间的新型评估指标来解决这一问题。该方法首先通过将基于外观中性的人类骨骼几何特征与基于外观的特征融合,捕捉真实世界运动的细微差别、约束及时间平滑性。我们认为,这种组合特征空间提供了动作合理性的稳健表征。给定生成视频后,我们的指标通过衡量其底层表征与所学习的真实世界动作分布之间的距离来量化其动作质量。为进行严格的验证,我们开发了一套新型的多维度基准,旨�探讨人类动作保真度的时序挑战性方面。通过大量实验,我们展示我们的指标在本基准上比现有最先进方法实现了超过 68% 的显著提升,在既有外部基准上表现具竞争力,并与人类感知呈现更强的相关性。我们的深入分析揭示了当前视频生成模型的关键局限性,并为高级视频生成研究树立了新标准。
引用
@article{arxiv.2512.01803,
title = {Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos},
author = {Xavier Thomas and Youngsun Lim and Ananya Srinivasan and Audrey Zheng and Deepti Ghadiyaram},
journal= {arXiv preprint arXiv:2512.01803},
year = {2025}
}