中文

超越多数投票:基于可解释SpeechLM框架的语音情感识别

音频与语音处理 2026-02-06 v2

摘要

语音情感识别(SER)通常在多数投票标签下进行训练和评估,这简化了基准测试但掩盖了主观性,提供了关于预测原因的有限透明度。这忽略了有效的少数注释,并限制了可解释性。我们提出一种可解释语音语言模型(SpeechLM)框架,将SER建模为生成式推理任务。给定语音输入,模型首先生成转录文本,然后输出情感标签和简洁的自然语言论证,论证基于词汇和声学线索。论证由能够进行推理的教师LLM生成,用于作为中间监督,同时结合多数标签进行微调。与先前工作主要关注提升分类准确率不同,我们旨在增强可解释性,同时保持竞争性能。为此,我们补充多数标签指标,引入基于注释者的评分,以奖励与任何注释者标签的匹配。在MSP-Podcast v1.12数据集上,我们的模型在保持零样本SpeechLM基线改进的同时,产生的论证被人类评估者认为是合理且充分依据的。这表明, incorporating rationale supervision 为在不牺牲预测质量的前提下实现可解释的SER提供了一条实用的路径。

关键词

引用

@article{arxiv.2509.24187,
  title  = {Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition},
  author = {Bo-Hao Su and Hui-Ying Shih and Jinchuan Tian and Jiatong Shi and Chi-Chun Lee and Carlos Busso and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2509.24187},
  year   = {2026}
}