中文

视频中的多标签微动作检测:MMAD

计算机视觉与模式识别 2025-08-21 v3

摘要

人体动作是社交交互中重要的非语言交流形式。本文特别关注称为微动作的动作子集,这些动作是细微、低强度的身体运动,具有良好的情感分析应用前景。在现实场景中,人类微动作常在时间上重叠 occur,例如头部和手部运动同时 occur。然而,当前研究主要关注识别单个微动作,忽略了它们的共现特性。为此,我们提出了名为多标签微动作检测 (MMAD) 的新任务,即识别给定短视频中所有微动作,确定其开始和结束时间,并对其进行分类。实现此任务需要能够准确捕获长期和短期动作关系的模型,以检测多个重叠的微动作。为促进 MMAD 任务,我们引入名为多标签微动作-52 (MMA-52) 的新数据集,并提出一种基线方法,采用双路径时空适配器以解决 MMAD 中细微视觉变化的挑战。我们希望 MMA-52 能刺激微动作视频分析领域的研究,并推动面向人类的视频理解中的时空建模的发展。 proposed MMA-52 数据集可在 https://github.com/VUT-HFUT/Micro-Action 获取。

关键词

引用

@article{arxiv.2407.05311,
  title  = {MMAD: Multi-label Micro-Action Detection in Videos},
  author = {Kun Li and Pengyu Liu and Dan Guo and Fei Wang and Zhiliang Wu and Hehe Fan and Meng Wang},
  journal= {arXiv preprint arXiv:2407.05311},
  year   = {2025}
}

备注

Accepted by ICCV 2025