EmoBox:多语种多语料库语音情感识别工具包与基准
声音
2024-06-12 v1 人工智能
计算与语言
多媒体
音频与语音处理
摘要
语音情感识别(SER)是人机交互的重要组成部分,受到产业界和学术界的广泛关注。然而,当前SER研究领域长期面临以下问题:1) 缺乏对数据集进行合理且通用的划分,使得比较不同模型和方法困难;2) 没有覆盖众多语料库和语言的常用基准,导致复现工作负担。本文提出EmoBox,一个即插即用的多语种多语料库语音情感识别工具包,以及用于内语料库和跨语料库设置的基准。对于内语料库设置,我们仔细设计了不同数据集的数据划分方案。对于跨语料库设置,我们采用情感识别基础模型emotion2vec,以缓解标注误差并获得在说话人和情感分布上完全均衡的测试集。基于EmoBox,我们呈现了在32个包含14种语言的情感数据集上10个预训练语音模型的内语料库SER结果,并在4个包含完全均衡测试集的跨语料库SER结果。迄今为止,这是规模最大、跨语言范围和数量规模最广的SER基准。我们希望我们的工具包和基准能够促进社区内的SER研究。
引用
@article{arxiv.2406.07162,
title = {EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark},
author = {Ziyang Ma and Mingjie Chen and Hezhao Zhang and Zhisheng Zheng and Wenxi Chen and Xiquan Li and Jiaxin Ye and Xie Chen and Thomas Hain},
journal= {arXiv preprint arXiv:2406.07162},
year = {2024}
}
备注
Accepted by INTERSPEECH 2024. GitHub Repository: https://github.com/emo-box/EmoBox