面向细粒度人体动作视频描述的模型
计算机视觉与模式识别
2025-10-30 v1 人工智能
摘要
生成人类动作视频中准确的描述仍是视频描述模型的挑战任务。现有方法常常难以捕捉细粒度动作细节,导致描述模糊或语义不一致。本文引入了运动增强描述模型 (M-ACM),一种新型生成框架,通过融合人体恢复得到的运动表示来增强描述质量,显式地突出人体动力学,从而减少幻觉并提高生成描述的语义忠实度和空间对齐度。在此基础上,我们提供了 Human Motion Insight (HMI) 数据集,包含 115K 条视频-描述对,专注于人体运动,并推出 HMI-Bench,用于评估以运动为中心的视频描述。实验结果表明,M-ACM 在准确描述复杂人体动作和细微时序变化方面显著优于先前方法,为运动导向的视频描述树立了新标准。
引用
@article{arxiv.2510.24767,
title = {Towards Fine-Grained Human Motion Video Captioning},
author = {Guorui Song and Guocun Wang and Zhe Huang and Jing Lin and Xuefei Zhe and Jian Li and Haoqian Wang},
journal= {arXiv preprint arXiv:2510.24767},
year = {2025}
}