CMD:基于跨模态互蒸馏的自监督 3D 动作表征学习
计算机视觉与模式识别
2023-05-26 v3
摘要
在 3D 动作识别中,骨架模态之间存在着丰富的互补信息。然而,如何建模并利用该信息仍是自监督 3D 动作表征学习中的一个挑战性问题。在本文中,我们将跨模态交互表述为一个双向知识蒸馏问题。与将固定且预训练的教师模型的知识迁移给学生的经典蒸馏方案不同,在本文中,知识在模态之间持续更新并双向蒸馏。为此,我们提出了一种新的跨模态互蒸馏(CMD)框架,其设计如下。一方面,引入邻域相似度分布来建模各模态中学习到的知识,其中关系信息天然适用于对比框架。另一方面,对教师和学生采用非对称配置,以稳定蒸馏过程并在模态间传递高置信度信息。通过推导,我们发现以往工作中的跨模态正样本挖掘可视为我们 CMD 的退化版本。我们在 NTU RGB+D 60、NTU RGB+D 120 和 PKU-MMD II 数据集上进行了大量实验。我们的方法优于现有的自监督方法,并创下一系列新纪录。代码见:https://github.com/maoyunyao/CMD
引用
@article{arxiv.2208.12448,
title = {CMD: Self-supervised 3D Action Representation Learning with Cross-modal Mutual Distillation},
author = {Yunyao Mao and Wengang Zhou and Zhenbo Lu and Jiajun Deng and Houqiang Li},
journal= {arXiv preprint arXiv:2208.12448},
year = {2023}
}
备注
To appear in ECCV 2022 (Oral)