中文

LAC:面向基于骨架的动作分割的潜动作组合

计算机视觉与模式识别 2024-02-22 v4

摘要

基于骨架的动作分割需要在未裁剪视频中识别可组合动作。现有方法将该问题解耦:先从骨架序列提取局部视觉特征,再由时序模型处理以分类逐帧动作。然而,由于视觉特征不足以表达可组合动作,其性能仍受限。对此,我们提出潜动作组合(LAC),一种新颖的自监督框架,旨在从合成的可组合运动中学习以用于基于骨架的动作分割。LAC由一个面向合成新序列的新颖生成模块组成。具体而言,我们在生成器中设计线性潜空间以表示基本运动。通过对多个输入骨架序列的潜表示进行算术运算,即可简单合成新的组合运动。LAC利用这些具有高度多样性和复杂性的合成序列,通过对比学习在序列和帧空间中学习骨架的视觉表示。所得视觉编码器具有高表达能力,并可通过端到端微调有效迁移到动作分割任务,无需额外的时序模型。我们聚焦于迁移学习开展研究,表明在TSU、Charades、PKU-MMD数据集上,预训练LAC学到的表示大幅优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.2308.14500,
  title  = {LAC: Latent Action Composition for Skeleton-based Action Segmentation},
  author = {Di Yang and Yaohui Wang and Antitza Dantcheva and Quan Kong and Lorenzo Garattoni and Gianpiero Francesca and Francois Bremond},
  journal= {arXiv preprint arXiv:2308.14500},
  year   = {2024}
}

备注

ICCV 2023