LAC:面向基于骨架的动作分割的潜动作组合
计算机视觉与模式识别
2024-02-22 v4
摘要
基于骨架的动作分割需要在未裁剪视频中识别可组合动作。现有方法将该问题解耦:先从骨架序列提取局部视觉特征,再由时序模型处理以分类逐帧动作。然而,由于视觉特征不足以表达可组合动作,其性能仍受限。对此,我们提出潜动作组合(LAC),一种新颖的自监督框架,旨在从合成的可组合运动中学习以用于基于骨架的动作分割。LAC由一个面向合成新序列的新颖生成模块组成。具体而言,我们在生成器中设计线性潜空间以表示基本运动。通过对多个输入骨架序列的潜表示进行算术运算,即可简单合成新的组合运动。LAC利用这些具有高度多样性和复杂性的合成序列,通过对比学习在序列和帧空间中学习骨架的视觉表示。所得视觉编码器具有高表达能力,并可通过端到端微调有效迁移到动作分割任务,无需额外的时序模型。我们聚焦于迁移学习开展研究,表明在TSU、Charades、PKU-MMD数据集上,预训练LAC学到的表示大幅优于当前最优(SOTA)方法。
引用
@article{arxiv.2308.14500,
title = {LAC: Latent Action Composition for Skeleton-based Action Segmentation},
author = {Di Yang and Yaohui Wang and Antitza Dantcheva and Quan Kong and Lorenzo Garattoni and Gianpiero Francesca and Francois Bremond},
journal= {arXiv preprint arXiv:2308.14500},
year = {2024}
}
备注
ICCV 2023