中文

跨空间协同:多模态情感识别的统一框架

多媒体 2026-03-24 v3 机器学习

摘要

多模态情感识别在对话情境(MERC)旨在通过整合文本、语音和视觉线索来预测说话者的情感。现有方法要么难以捕捉复杂的跨模态交互,要么在使用更深层架构时出现梯度冲突和训练不稳定。为此,我们提出了跨空间协同(Cross-Space Synergy, CSS),它将表示组件与优化组件进行耦合。 synergistic Polynomial Fusion(SPF)承担表示角色,利用低秩张量分解高效捕捉高阶跨模态交互。Pareto Gradient Modulator(PGM)承担优化角色,沿帕累托最优方向引导更新,以缓解梯度冲突并提升稳定性。实验表明,CSS 在 IEMOCAP 和 MELD 数据集上在准确率和训练稳定性方面均优于现有代表性方法,展示了其在复杂多模态情境中的有效性。

关键词

引用

@article{arxiv.2512.03521,
  title  = {Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation},
  author = {Xiaosen Lyu and Jiayu Xiong and Yuren Chen and Wanlong Wang and Xiaoqing Dai and Jing Wang},
  journal= {arXiv preprint arXiv:2512.03521},
  year   = {2026}
}

备注

Accepted to AAAI 2026