中文

使用修剪骨架视频进行人类动作分割的 Stitch 对比与 Segment 学习

计算机视觉与模式识别 2024-12-24 v2 机器学习

摘要

现有的骨架基于的人类动作分类模型依赖于用于训练和测试的经过精心裁剪的动作特定骨架视频,从而限制了其在实际应用中的可扩展性,而实际应用中动作串联的未裁剪视频占主导地位。为克服这一限制,最近引入的骨架动作分割模型将未裁剪的骨架视频纳入端到端训练。该模型被优化以对任意长度的测试视频提供帧级预测,同时实现动作局化和分类。然而,实现这一改进的前提是需要帧级标注的骨架视频,而这在实践中仍然耗时。本文提出了一种 novel 框架,用于在短裁剪骨架视频上训练的骨架动作分割模型,却可在更长的未裁剪视频上运行。该方法包含三个步骤:Stitch、Contrast 和 Segment。首先,Stitch 提出了一种骨架时间拼接方案,将裁剪后的骨架视频视为组成语义空间的基本人类运动,可进行采样以生成多动作拼接序列。Contrast 通过一种 novel 判别性预任务从拼接序列中学习对比表示,使骨架编码器能够学习有意义的动作-时间上下文,以提高动作分割效果。最后,Segment 将所提方法与动作分割相关联,通过学习分割层来处理特定的数据可用性问题。实验涉及裁剪源数据集和未裁剪目标数据集,采用适应性 formulation 评估所提方法在现实世界骨架-based 人类动作分割中的效果。

关键词

引用

@article{arxiv.2412.14988,
  title  = {Stitch Contrast and Segment_Learning a Human Action Segmentation Model Using Trimmed Skeleton Videos},
  author = {Haitao Tian and Pierre Payeur},
  journal= {arXiv preprint arXiv:2412.14988},
  year   = {2024}
}

备注

Accepted at AAAI 2025