中文

基于多门控机制与神经架构搜索的多语种语音情感识别

声音 2022-11-17 v2 计算与语言 音频与语音处理

摘要

语音情感识别(SER)将音频分类为快乐、愤怒、恐惧、厌恶和中性等情绪类别。尽管SER在主流语言中已是常见应用,但对于低资源语言(即无预训练语音转文本识别模型的语言)仍是一个难题。本文首先提出一种语言特定模型,从多个预训练语音模型中提取情感信息,随后设计了一种可同时对多种语言执行SER的多领域模型。我们的多领域模型采用多门控机制为每种语言生成独特的加权特征组合,并通过神经架构搜索模块为每种语言搜索特定的神经网络结构。此外,我们引入对比辅助损失,为音频数据构建更具可分性的表征。实验表明,我们的模型将德语的准确率提升至超过现有最优3%,法语超过14.3%。

关键词

引用

@article{arxiv.2211.08237,
  title  = {Multilingual Speech Emotion Recognition With Multi-Gating Mechanism and Neural Architecture Search},
  author = {Zihan Wang and Qi Meng and HaiFeng Lan and XinRui Zhang and KeHao Guo and Akshat Gupta},
  journal= {arXiv preprint arXiv:2211.08237},
  year   = {2022}
}