面向多模态情感分析的文本路由稀疏混合专家模型及其解释与时序对齐
计算与语言
2025-12-30 v1
摘要
涉及人类交互的应用场景凸显了多模态情感分析(MSA)的必要性。尽管已提出许多方法来解决不同模态中细腻情绪的表现,但解释力与时序对齐的作用仍受到 insufficient 探索。因此,本文提出了一种面向MSA的文本路由稀疏混合专家模型,集成解释与时序对齐功能(TEXT)。TEXT 首先通过多模态大语言模型(MLLM)增强MSA的解释性,然后创新性地通过时序导向的神经网络模块对音频和视频的表征进行时序对齐。TEXT 融合解释机制,实现跨模态的对齐,并构建新的文本路由稀疏混合专家架构。我们的时序对齐模块融合了 Mamba 与时序跨注意力的优势。实验结果表明,TEXT 在四个数据集上均实现了当前所有测试模型的最佳性能,包括三种近期提出的方法和三种 MLLM。TEXT 在六项指标中至少获胜四项。例如,TEXT 在 CH-SIMS 数据集上的平均绝对误差降至 0.353,较近期方法下降 13.5%。
引用
@article{arxiv.2512.22741,
title = {Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis},
author = {Dongning Rao and Yunbiao Zeng and Zhihua Jiang and Jujian Lv},
journal= {arXiv preprint arXiv:2512.22741},
year = {2025}
}
备注
9 pages, 9 figures, accepted by AAAI 2026