投影特征对齐的正交解缔:多模态情感识别中的对话
多媒体
2026-02-12 v3
摘要
多模态情感识别在对话(Multimodal Emotion Recognition in Conversation, MERC)显著提升了情感识别性能,通过整合文本、音频和视觉模态中的互补情感线索。虽然现有方法常采用对比学习和跨注意力机制等技术来对齐跨模态情感语义,但通常忽视如微表情、语调变化和讽刺语言等模态特定的情感细节。为克服这些限制,我们提出一种正交解缔结合投影特征对齐(Orthogonal Disentanglement with Projected Feature Alignment, OD-PFA),旨在捕捉共享语义与模态特定情感线索。我们的方法首先将单模态特征解耦分为共享组件和模态特定组件。正交解缔策略(OD)强制这些组件之间实现有效分离,辅以重建损失以保持每个模态中关键情感信息。此外,投影特征对齐策略(PFA)将跨模态共享特征映射到 common latent space,并应用跨模态一致性对齐损失以增强语义连贯性。广泛的在IEMOCAP和MELD等常用基准数据集上的大量评估表明,我们提出的OD-PFA在多模态情感识别任务中有效。
引用
@article{arxiv.2511.22463,
title = {Orthogonal Disentanglement with Projected Feature Alignment for Multimodal Emotion Recognition in Conversation},
author = {Xinyi Che and Wenbo Wang and Jian Guan and Qijun Zhao},
journal= {arXiv preprint arXiv:2511.22463},
year = {2026}
}
备注
5 pages, 1 figure