中文

SELM:用于提升情感语音识别的 out-of-domain 场景表现

声音 2024-07-23 v1 音频与语音处理

摘要

情感语音识别 (SER) 传统上被形式化为分类任务。然而,情感通常是一个谱,其分布会因情境而异,导致较差的 out-of-domain (OOD) 性能。我们借鉴自动语音识别 (ASR) 的统计公式化方法,将 SER 任务形式化为生成推断情感最可能文本序列的任务。该公式将 SER 划分为预测加权由语言模型预测的声学模型特征。作为该方法的一个实例,我们提出了 SELM——一种面向 SER 的音频条件语言模型,能够预测不同的情感视图。我们在精选的语音情感语料库上训练 SELM,并在三个未用于训练的 OOD 数据集 (RAVDESS、CREMAD、IEMOCAP) 上进行测试。SELM 在 RAVDESS 和 CREMA-D 上的相对准确率分别提高了 17% 和 7%。此外,SELM 还可以通过少数标注示例进行 few-shot 学习以进一步提升性能。结果凸显了该 SER 公式的有效性,尤其是在提升 OOD 场景下的表现。

关键词

引用

@article{arxiv.2407.15300,
  title  = {SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios},
  author = {Hazim Bukhari and Soham Deshmukh and Hira Dhamyal and Bhiksha Raj and Rita Singh},
  journal= {arXiv preprint arXiv:2407.15300},
  year   = {2024}
}

备注

Accepted at INTERSPEECH 2024