MSF-SER:基于多粒度语义丰富语音情感识别的声学模型
声音
2026-01-27 v2
摘要
连续维度语音情感识别沿价值(valence)、唤醒(arousal)和支配(dominance)三个维度捕捉情感变化,提供比分类方法更细粒度的表征。然而,大多数多模态方法仅依赖全局转录,导致两个局限性:(1)所有词都被视为等价,忽略了对句子不同部分的强调可能改变情感含义;(2)仅表示表层词汇内容,缺乏更高层次的解释性线索。为克服这些问题,我们提出MSF-SER(Multi-granularity Semantic Fusion for Speech Emotion Recognition),通过对 acoustic features with三个互补的文本语义层次——局部强调语义(LES)、全局语义 GS)和扩展语义(ES)。这些通过一种 intra-modal gated fusion and a cross-modal FiLM-modulated lightweight Mixture-of-Experts (FM-MOE)进行集成。实验在MSP-Podcast和IEMOCAP上显示,MSF-SER在维度化预测方面 consistently improve,证明了丰富语义融合对语音情感识别的有效性。
引用
@article{arxiv.2510.05749,
title = {MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition},
author = {Haoxun Li and Yuqing Sun and Hanlei Shi and Yu Liu and Leyuan Qu and Taihao Li},
journal= {arXiv preprint arXiv:2510.05749},
year = {2026}
}
备注
Accepted by ICASSP 2026