SpeechEQ:基于多尺度统一数据集与多任务学习的语音情感识别
声音
2022-07-29 v2 机器学习
音频与语音处理
摘要
语音情感识别(SER)面临诸多挑战,其中主要挑战之一是各框架缺乏统一标准。本文提出 SpeechEQ,一种基于多尺度统一度量的 SER 任务统一框架。该度量可通过多任务学习(MTL)进行训练,包含情绪状态类别(EIS)与情绪强度尺度(EIS)两个情感识别任务,以及音素识别和性别识别两个辅助任务。针对该框架,我们构建了普通话 SER 数据集——SpeechEQ 数据集(SEQD)。我们在普通话公开数据集 CASIA 和 ESD 上进行了实验,结果表明我们的方法大幅优于基线方法,准确率分别提升 8.0% 和 6.5%。在 IEMOCAP 上针对四类情绪(即生气、高兴、悲伤、中性)的额外实验也显示,所提方法在加权准确率(WA)78.16% 和非加权准确率(UA)77.47% 上均达到了最先进水平。
引用
@article{arxiv.2206.13101,
title = {SpeechEQ: Speech Emotion Recognition based on Multi-scale Unified Datasets and Multitask Learning},
author = {Zuheng Kang and Junqing Peng and Jianzong Wang and Jing Xiao},
journal= {arXiv preprint arXiv:2206.13101},
year = {2022}
}
备注
This paper is accepted by Interspeech 2022