中文

用于情感识别的解耦多模态蒸馏方法

计算机视觉与模式识别 2023-03-27 v1

摘要

人类多模态情感识别(MER)旨在透过语言、视觉和声音模态感知人类情感。尽管先前的MER方法性能令人印象深刻,固有的多模态异质性仍困扰着该任务,且不同模态的贡献差异显著。本工作中,我们通过提出一种解耦多模态蒸馏(DMD)方法来缓解此问题,该方法促进灵活且自适应的跨模态知识蒸馏,旨在增强各模态的判别性特征。特别地,每个模态的表示以自回归方式解耦为两部分,即模态无关/模态独占空间。DMD为各解耦部分使用图蒸馏单元(GD-Unit),使每个GD能以更专门且有效的方式执行。GD-Unit由动态图构成,其中每个顶点代表一个模态,每条边表示一次动态知识蒸馏。此种GD范式提供了一种灵活的知识迁移方式,蒸馏权重可自动学习,从而实现多样的跨模态知识迁移模式。实验结果表明DMD持续取得优于SOTA的MER方法的性能。可视化结果显示DMD中的图边相对于模态无关/模态独占特征空间呈现出有意义的分布模式。代码发布于\url{https://github.com/mdswyz/DMD}。

关键词

引用

@article{arxiv.2303.13802,
  title  = {Decoupled Multimodal Distilling for Emotion Recognition},
  author = {Yong Li and Yuanzhi Wang and Zhen Cui},
  journal= {arXiv preprint arXiv:2303.13802},
  year   = {2023}
}

备注

To appear at CVPR 2023, selected as a hightlight, 10% of accepted papers, 2.5% of submissions