中文

ActionArt:面向细粒度人类中心视频理解的多模态大模型进阶

计算机视觉与模式识别 2025-04-28 v1

摘要

对人类动作和姿态在视频中的细粒度理解是人类中心 AI 应用的关键。本文引入 ActionArt,一个用于推动人类中心多模态理解研究的细粒度视频描述数据集。该数据集包含数千个视频,涵盖广泛的人类动作、人物-物体交互及多样化场景,每个视频都配有详细标注,细致标注每一块肢体动作。我们开发了八个子任务,以评估现有大型多模态模型在不同维度上的细粒度理解能力。实验结果表明,尽管当前大型多模态模型在各类任务上表现尚可,但往往在实现细粒度理解方面存在不足。我们认为这一局限性源于细粒度标注数据的稀缺,这类标注既昂贵又难以大规模扩展。鉴于手动标注成本高且难以扩展,我们提出代理任务以增强模型在空间和时间维度上的感知能力。这些代理任务经过精心设计,由现有 MLLM 自动生成数据驱动,从而减少对高成本人工标注的依赖。实验结果表明,所提出的代理任务显著缩小了与使用手动标注细粒度数据所达到的性能之间的差距。

关键词

引用

@article{arxiv.2504.18152,
  title  = {ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding},
  author = {Yi-Xing Peng and Qize Yang and Yu-Ming Tang and Shenghao Fu and Kun-Yu Lin and Xihan Wei and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2504.18152},
  year   = {2025}
}