用于增强语音情感识别的情感感知自动语音识别预训练
计算与语言
2022-01-31 v1 声音
音频与语音处理
摘要
我们提出了一种用于语音情感识别(SER)的新型多任务预训练方法。我们在自动语音识别(ASR)与情感分类任务上同时预训练 SER 模型,以使声学 ASR 模型更具“情感感知”能力。我们使用在公开可用数据上训练的文本到情感模型为情感分类生成目标。最后,我们在情感标注的语音数据上对声学 ASR 进行微调。我们在 MSP-Podcast 数据集上评估了所提方法,在效价预测上取得了已报道的最佳一致性相关系数(CCC)0.41。
引用
@article{arxiv.2201.11826,
title = {Sentiment-Aware Automatic Speech Recognition pre-training for enhanced Speech Emotion Recognition},
author = {Ayoub Ghriss and Bo Yang and Viktor Rozgic and Elizabeth Shriberg and Chao Wang},
journal= {arXiv preprint arXiv:2201.11826},
year = {2022}
}
备注
ICASSP 2022