中文

情感识别的多模态共识校准

计算机视觉与模式识别 2025-10-24 v1 计算与语言 机器学习 多媒体

摘要

近年来,多模态情感识别(MER)取得了显著进展。然而,大多数现有方法忽略了跨模态可能出现的语义不一致问题,例如文本和视觉输入之间存在冲突的情感线索。此外,当前方法往往被文本模态主导,因为其表示能力强,这可能损害识别准确性。为此,我们提出一种称为校准多模态共识(CMC)的模型。CMC引入伪标签生成模块(PLGM),以生成伪单模态标签,实现自监督式单模态预训练。随后采用无参数融合模块(PFM)和多模态共识路由器(MCR)进行多模态微调,从而缓解文本主导并引导融合过程走向更可靠的共识。实验结果表明,CMC 在 CH-SIMS、CH-SIMS v2、CMU-MOSI 和 CMU-MOSEI 四个数据集上达到与或优于当前最先进方法的性能,在 CH-SIMS 和 CH-SIMS v2 上在语义不一致场景中表现尤为突出。本作品实现已公开于 https://github.com/gw-zhong/CMC。

关键词

引用

@article{arxiv.2510.20256,
  title  = {Calibrating Multimodal Consensus for Emotion Recognition},
  author = {Guowei Zhong and Junjie Li and Huaiyu Zhu and Ruohong Huan and Yun Pan},
  journal= {arXiv preprint arXiv:2510.20256},
  year   = {2025}
}