视觉-语言遇见骨架:基于跨模态知识渐进蒸馏的3D动作表示学习
计算机视觉与模式识别
2024-09-17 v2 人工智能
机器学习
多媒体
摘要
基于骨架的动作表示学习旨在通过编码骨架序列来解读和理解人类行为,可分为两种主要训练范式:监督学习和自监督学习。然而,前者的独热分类需要劳动密集型的预定义动作类别标注,而后者在预文本任务中涉及的骨架变换(例如裁剪)可能会破坏骨架结构。为应对这些挑战,我们引入了一种新颖的基于骨架的训练框架CVL,该框架基于跨模态对比学习,利用渐进蒸馏从视觉-语言知识提示中学习与任务无关的人体骨架动作表示。具体来说,我们通过预训练的大规模多模态模型生成的视觉-语言知识提示来建立视觉-语言动作概念空间,这丰富了骨架动作空间所缺乏的细粒度细节。此外,我们在跨模态表示学习过程中提出了模态内自相似性和模态间交叉一致性软化目标,以渐进地控制和引导视觉-语言知识提示与相应骨架的拉近程度。这些软实例判别和自知识蒸馏策略有助于从含噪的骨架-视觉-语言对中学习更好的基于骨架的动作表示。在推理阶段,我们的方法仅需骨架数据作为动作识别的输入,不再需要视觉-语言提示。在NTU RGB+D 60、NTU RGB+D 120和PKU-MMD数据集上的大量实验表明,我们的方法优于先前的方法,并达到了最先进的性能。代码可在 https://github.com/cseeyangchen/C2VL 获取。
引用
@article{arxiv.2405.20606,
title = {Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning},
author = {Yang Chen and Tian He and Junfeng Fu and Ling Wang and Jingcai Guo and Ting Hu and Hong Cheng},
journal= {arXiv preprint arXiv:2405.20606},
year = {2024}
}
备注
Accepted by IEEE Transactions on Multimedia