利用最优传输蒸馏特权多模态信息进行表情识别
计算机视觉与模式识别
2024-04-30 v3 人工智能
摘要
用于多模态表情识别的深度学习模型因其学习互补和冗余语义信息的能力,在受控实验室环境中取得了显著性能。然而,这些模型在自然场景中表现不佳,主要原因是用于训练模态的不可用性和质量问题。实际上,在测试时可能只能获得训练时模态的一个子集。利用特权信息学习使模型能够利用仅在训练期间可用的额外模态数据。目前最先进的知识蒸馏(KD)方法已被提出,用于将信息从多个教师模型(每个模型在一个模态上训练)蒸馏到一个共同的学生模型。这些特权知识蒸馏方法通常采用点对点匹配,但缺乏显式机制来捕获因引入特权模态而形成的教师表征空间中的结构信息。我们在两个具有挑战性的问题上进行了实验:Biovid数据集上的疼痛估计(有序分类)和Affwild2数据集上的唤醒度-效价预测(回归)。结果表明,我们提出的方法在这些问题上能够超越最先进的特权知识蒸馏方法。模态和融合架构的多样性表明,PKDOT与模态和模型无关。
引用
@article{arxiv.2401.15489,
title = {Distilling Privileged Multimodal Information for Expression Recognition using Optimal Transport},
author = {Muhammad Haseeb Aslam and Muhammad Osama Zeeshan and Soufiane Belharbi and Marco Pedersoli and Alessandro Koerich and Simon Bacon and Eric Granger},
journal= {arXiv preprint arXiv:2401.15489},
year = {2024}
}