中文

FineParser:用于以人为中心的动作质量评估的细粒度时空动作解析器

计算机视觉与模式识别 2024-05-14 v1

摘要

现有的动作质量评估(AQA)方法主要在视频层面学习深度表示,以对各种动作进行评分。由于缺乏对视频中动作的细粒度理解,这些方法在可信度和可解释性方面存在严重不足,因此难以满足奥运会跳水等严格要求的应用场景。我们认为,对动作的细粒度理解要求模型在时间和空间上感知并解析动作,这也是 AQA 技术可信度和可解释性的关键。基于这一洞察,我们提出了一种新的细粒度时空动作解析器,命名为 \textbf{FineParser}。它通过关注每一帧内的目标动作区域,并利用其在时间和空间上的细粒度对齐来学习以人为中心的前景动作表示,从而在评估过程中最大限度地减少无效背景的影响。此外,我们为 FineDiving 数据集构建了以人为中心的前景动作掩码的细粒度标注,称为 \textbf{FineDiving-HM}。凭借对多样化目标动作过程的精细标注,FineDiving-HM 能够促进现实世界 AQA 系统的发展。通过大量实验,我们证明了 FineParser 的有效性,它在支持更多细粒度动作理解任务的同时,优于 SOTA 方法。数据和代码可在 \url{https://github.com/PKU-ICST-MIPL/FineParser_CVPR2024} 获取。

关键词

引用

@article{arxiv.2405.06887,
  title  = {FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality Assessment},
  author = {Jinglin Xu and Sibo Yin and Guohao Zhao and Zishuo Wang and Yuxin Peng},
  journal= {arXiv preprint arXiv:2405.06887},
  year   = {2024}
}

备注

Accepted by CVPR 2024