用于多模态情感识别对话的混合专家模型
计算与语言
2026-02-27 v1 音频与语音处理
摘要
情感识别在对话中(ERC)具有独特挑战,要求模型捕捉多轮对话的时序流程,并有效整合来自多模态的线索。我们提出 Mixture of Speech-Text Experts for Recognition of Emotions (MiSTER-E),一种模块化混合专家(Mixture-of-Experts, MoE)框架,旨在解耦 ERC 中的两个核心挑战:模态特定的上下文建模与多模态信息融合。MiSTER-E 利用为语音和文本各精调的大型语言模型(LLM),提供丰富的句子级嵌入,并通过卷积-循环上下文建模层进行强化。该系统集成来自三个专家-语音专家、文本专家和跨模态专家-的预测输出,并通过学习到的门控机制动态加权其输出。为进一步鼓励跨模态的一致性与对齐,我们引入监督对比损失用于配对语音-文本表示之间,以及基于 KL 散度的正则化用于专家预测之间。重要的是,MiSTER-E 在任何阶段都不依赖说话者身份。在三个基准数据集-IEMOCAP、MELD 和 MOSI 上实验表明,我们的方案分别实现了 70.9%、69.5% 和 87.9% 加权 F1 分数,优于多个基于语音-文本的 ERC 基线系统。我们还提供了各种消融实验,以凸显所提出方法的贡献。
引用
@article{arxiv.2602.23300,
title = {A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations},
author = {Soumya Dutta and Smruthi Balaji and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2602.23300},
year = {2026}
}
备注
Accepted to Elsevier Computer Speech and Language. 30 pages, 9 figures, 5 tables