中文

当语调与词汇相左:面向声学-语义冲突下鲁棒语音情感识别的研究

声音 2026-01-09 v1

摘要

语音情感识别(SER)系统通常假设声音情感与词汇语义一致。然而,在真实世界交互中,声学-语义冲突很常见却被忽视,即语调传达的情感与说出词汇的字面意思相矛盾。我们表明,最先进的 SER 模型,包括基于 ASR 的方法、自监督学习(SSL)方法和音频语言模型,由于语义偏差或纠缠的声学-语义表示,在此类冲突下会出现性能下降。为了解决这一问题,我们提出了融合声学-语义框架,该框架显式地解耦声学和语义路径,并通过一个轻量级的、基于查询的注意力模块将它们桥接起来。为了实现系统性评估,我们引入了 CASE,这是第一个以各种场景中清晰且可解释的声学-语义冲突为主导的数据集。大量实验表明,FAS 在域内和零样本设置下均持续优于现有方法。值得注意的是,在 CASE 基准上,传统 SER 模型严重失效,而 FAS 以 59.38% 的准确率创下了新的 SOTA。我们的代码和数据集可在 https://github.com/24DavidHuang/FAS 获取。

关键词

引用

@article{arxiv.2601.04564,
  title  = {When Tone and Words Disagree: Towards Robust Speech Emotion Recognition under Acoustic-Semantic Conflict},
  author = {Dawei Huang and Yongjie Lv and Ruijie Xiong and Chunxiang Jin and Xiaojiang Peng},
  journal= {arXiv preprint arXiv:2601.04564},
  year   = {2026}
}