SERAB:一种用于语音情感识别的多语言基准
声音
2021-10-08 v1 人工智能
机器学习
音频与语音处理
摘要
语音情感识别(SER)的近期进展常利用深度神经网络(DNNs)。由于使用不同的数据集和评估协议,比较和基准测试不同的 DNN 模型往往十分繁琐。为简化该过程,我们在此提出语音情感识别自适应基准(SERAB),一个用于评估语句级 SER 不同方法的性能与泛化能力的框架。该基准由六种语言的九个 SER 数据集组成。由于各数据集的规模和情感类别数量不同,所提出的设置特别适合估计基于 DNN 的预训练特征提取器的泛化能力。我们使用所提出的框架评估了一系列标准手工特征集和最先进的 DNN 表示。结果强调,仅使用 SERAB 中包含的数据子集会导致有偏评估,而遵循所提出的协议可规避此问题。
引用
@article{arxiv.2110.03414,
title = {SERAB: A multi-lingual benchmark for speech emotion recognition},
author = {Neil Scheidwasser-Clow and Mikolaj Kegler and Pierre Beckmann and Milos Cernak},
journal= {arXiv preprint arXiv:2110.03414},
year = {2021}
}
备注
Submitted to ICASSP 2022