中文

KPM-Bench:用于细粒度运动中心视频理解的运动解析基准

计算机视觉与模式识别 2026-02-23 v1

摘要

尽管近期取得的进展,视频字幕模型仍面临在准确描述细粒度运动细节方面存在显著局限性,并在生成运动中心视频的字幕时出现严重的幻觉问题。这些挑战在生成运动中心视频的字幕时尤为突出,因为精确描绘复杂运动和肢体动力学至关重要但常被忽视。为缓解这一差距,我们引入了一个集成运动计算与语言解析的自动标注管道,以详细分解和描述复杂的人类运动。基于该管道,我们构建并发布了运动解析运动基准(KPM-Bench),一个旨在促进细粒度运动理解的新型开源数据集。KPM-Bench 包括 (i) 全面描绘复杂动作中肢体水平动力学的细粒度视频-字幕对, (ii) 专门针对运动理解的多样且具有挑战性的问答对,以及 (iii) 精心策划的评估集,专为评估与运动描述相关的幻觉现象而设计。此外,为系统性地解决幻觉问题,我们提出了以语言为基础的运动解析与提取(MoPE)算法,能够准确从文本字幕中提取运动特定属性。利用 MoPE,我们引入了一个独立于大规模视觉-语言或语言-only 模型的精确幻觉评估指标。通过将 MoPE 集成到 GRPO post-training 框架中,我们有效缓解了运动中心视频字幕模型的幻觉问题,显著提高了其可靠性。

关键词

引用

@article{arxiv.2602.17768,
  title  = {KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding},
  author = {Boda Lin and Yongjie Zhu and Xiaocheng Gong and Wenyu Qin and Meng Wang},
  journal= {arXiv preprint arXiv:2602.17768},
  year   = {2026}
}

备注

26 pages