中文

通过上下文感知与思维链引导语言模型实现稳定的语音情感识别

声音 2025-12-30 v3 计算与语言 音频与语音处理

摘要

大规模音频语言模型(ALMs),如 Qwen2-Audio,能够理解多种音频信号、执行音频分析并生成文本响应。然而,在语音情感识别(SER)中,ALMs 经常遭受幻觉,导致误分类或无关输出。为应对这些挑战,我们提出了 C²SER——一种新型 ALM,旨在通过上下文感知(Contextual Perception)和思维链(Chain of Thought,CoT)提升 SER 的稳定性和准确性。C²SER 集成了 Whisper 编码器进行语义感知和 Emotion2Vec-S 进行声学感知,其中 Emotion2Vec-S 通过半监督学习扩展了 Emotion2Vec,以增强情感判别能力。此外,C²SER 采用 CoT 方法,以逐步方式处理 SER,同时利用语音内容和说话风格来提升识别性能。为进一步增强稳定性,C²SER 引入了从显式 CoT 到隐式 CoT 的自蒸馏,以减轻误差累积并提升识别准确率。大量实验表明,C²SER 优于现有的流行 ALMs,如 Qwen2-Audio 和 SECap,能够提供更稳定、更精确的情感识别。我们发布了训练代码、检查点和测试集,以促进进一步研究。

关键词

引用

@article{arxiv.2502.18186,
  title  = {Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of Thought},
  author = {Zhixian Zhao and Xinfa Zhu and Xinsheng Wang and Shuiyuan Wang and Xuelong Geng and Wenjie Tian and Lei Xie},
  journal= {arXiv preprint arXiv:2502.18186},
  year   = {2025}
}

备注

This work has been published in IEEE Transactions on Audio, Speech and Language Processing