跨空间协同:多模态情感识别的统一框架
多媒体
2026-03-24 v3 机器学习
摘要
多模态情感识别在对话情境(MERC)旨在通过整合文本、语音和视觉线索来预测说话者的情感。现有方法要么难以捕捉复杂的跨模态交互,要么在使用更深层架构时出现梯度冲突和训练不稳定。为此,我们提出了跨空间协同(Cross-Space Synergy, CSS),它将表示组件与优化组件进行耦合。 synergistic Polynomial Fusion(SPF)承担表示角色,利用低秩张量分解高效捕捉高阶跨模态交互。Pareto Gradient Modulator(PGM)承担优化角色,沿帕累托最优方向引导更新,以缓解梯度冲突并提升稳定性。实验表明,CSS 在 IEMOCAP 和 MELD 数据集上在准确率和训练稳定性方面均优于现有代表性方法,展示了其在复杂多模态情境中的有效性。
引用
@article{arxiv.2512.03521,
title = {Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation},
author = {Xiaosen Lyu and Jiayu Xiong and Yuren Chen and Wanlong Wang and Xiaoqing Dai and Jing Wang},
journal= {arXiv preprint arXiv:2512.03521},
year = {2026}
}
备注
Accepted to AAAI 2026