中文

VIFSS:面向时序动作分割的视图无关和花滑专用姿态表示学习

计算机视觉与模式识别 2025-08-15 v1

摘要

从视频中理解人类动作在 various 领域发挥着关键作用,包括体育分析。 在花滑运动中,准确识别跳台的类型和时间对于客观绩效评估至关重要。然而,该任务通常需要专家水平的知识,因为跳台程序细致且复杂。虽然最近的研究尝试使用时序动作分割(TAS)自动化此任务,但TAS在花滑领域存在两个主要局限性:标注数据不足,以及现有方法未考虑跳动动作的固有三维性质和程序结构。本文提出了一个用于花滑跳台的新型TAS框架,显式地融合了三维性质和动作语义程序。首先,我们提出了一种新的视图无关、花滑专用姿态表示学习方法(VIFSS),将对比学习作为预训练和动作分类作为微调。对于视图无关对比预训练,我们构建了 FS-Jump3D,即首个面向花滑跳台的公共3D姿态数据集。其次,我们引入细粒度标注方案,标记“entry(准备)”和“landing(着陆)”阶段,使TAS模型能够学习跳台的程序结构。大量实验表明,我们的框架有效。本方法在元素级TAS上实现了 92% 以上的 F1@50,该任务需要识别跳台类型和旋转水平。此外,我们展示了在微调数据有限的情况下,视图无关对比预训练特别有效,凸显了该方法在实际场景中的实用性。

关键词

引用

@article{arxiv.2508.10281,
  title  = {VIFSS: View-Invariant and Figure Skating-Specific Pose Representation Learning for Temporal Action Segmentation},
  author = {Ryota Tanaka and Tomohiro Suzuki and Keisuke Fujii},
  journal= {arXiv preprint arXiv:2508.10281},
  year   = {2025}
}