语言辅助的人类部位运动学习用于骨架基准的时序动作分割
摘要
基于骨架的时序动作分割涉及对可变长度骨架序列进行稠密动作分类。当前方法主要应用基于图的网络来提取帧级的整体身体层面的运动表征,并使用 one-hot 编码的标签进行模型优化。然而,整体身体的运动表征无法捕捉细粒度的部位层面运动表征,而 one-hot 编码的标签又忽略了语言基础动作定义中内在的语义关系。为此,我们提出了一种新方法,称为 Language-assisted Human Part Motion Representation Learning (LPL),其中包含用于提取双层(即部位和整体身体)运动表征的解耦部位运动编码器 (Disentangled Part Motion Encoder, DPE),以及用于优化表征中空间关系的语言辅助分布对齐 (Language-assisted Distribution Alignment, LDA) 策略。具体而言,经过 DPE 对部位感知的骨架编码后,LDA 通过大规模语言模型生成双层动作描述,以构建文本嵌入空间。随后,LDA 动机在文本描述与运动之间的嵌入空间对齐。这种对齐不仅使 LDA 能够增强类内紧凑性,还能将语言编码的动作间语义关联性传递到骨架基准运动学习中。此外,我们提出了一种简单而高效的语义偏移适配器 (Semantic Offset Adapter) 来平滑跨域的误差。我们的实验表明,LPL 在各种数据集上实现了状态的最佳性能(例如,在 PKU-MMD 数据集上准确率提升 +4.4%,F1 分数提升 +5.6%)。此外,LDA 与现有方法兼容,且无需额外推理成本即可提升其性能(例如,在 LARa 数据集上准确率提升 +4.8%,F1 分数提升 +4.3%)。
引用
@article{arxiv.2410.06353,
title = {Language-Assisted Human Part Motion Learning for Skeleton-Based Temporal Action Segmentation},
author = {Bowen Chen and Haoyu Ji and Zhiyong Wang and Benjamin Filtjens and Chunzhuo Wang and Weihong Ren and Bart Vanrumste and Honghai Liu},
journal= {arXiv preprint arXiv:2410.06353},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication