中文

多教师特权知识蒸馏用于多模态情感识别

计算机视觉与模式识别 2024-08-20 v1

摘要

情感是一种通过面部表情、语调、身体语言和生理信号传递和感知的复杂现象。多模态情感识别系统之所以表现良好,是因为它们可以从多种传感器中学习互补和冗余的语义信息。在实际场景中,训练时使用的子集模态在测试时可能不可用。学习特权信息允许模型在训练时利用仅在训练时可用的额外模态。已提出多种 PKD 方法,从教师模型(带特权模态)蒸馏信息到学生模型(不带特权模态)。然而,这些 PKD 方法采用点到点匹配,未显式捕获关系信息。最近提出的方法尝试蒸馈结构信息。然而,基于结构相似性的 PKD 方法主要局限于从单一联合教师表示中学习,这限制了其鲁棒性、准确性以及从多样化多模态来源学习的能力。本文引入一种带有自蒸馏的多教师 PKD (MT-PKDOT) 方法,以对齐来自不同教师的多样化表示后再蒸馈到学生。MT-PKDOT 基于正则化最优传输 (OT) 的结构相似性 KD 机制实现蒸馈。在 Affwild2 和 Biovid 数据集上验证了所提出的 MT-PKDOT 方法。结果表明,我们的方法优于 SOTA PKD 方法。在 Biovid 数据集上,方法将视觉单模态基线提升了 5.5%。在 Affwild2 数据集上,方法分别将视觉单模态基线的价值 (valence) 和 arousal 提升了 3% 和 5%。允许学生从多个多样化来源学习被证明可以提高准确性,并隐式避免对学生模型产生负迁移。

关键词

引用

@article{arxiv.2408.09035,
  title  = {Multi Teacher Privileged Knowledge Distillation for Multimodal Expression Recognition},
  author = {Muhammad Haseeb Aslam and Marco Pedersoli and Alessandro Lameiras Koerich and Eric Granger},
  journal= {arXiv preprint arXiv:2408.09035},
  year   = {2024}
}