中文

EMOVOME:面向自发真实生活语音的情感识别数据集

音频与语音处理 2024-12-05 v3 人工智能 计算与语言 声音

摘要

用于语音情感识别 (SER) 的自发数据集非常稀缺,且通常源自实验室环境或电视节目等舞台场景,这限制了它们在真实世界中的应用。我们开发并公开发布了情感语音消息 (EMOVOME) 数据集,包含来自 100 名西班牙语说话者在消息应用上真实对话的 999 条语音消息,并由专家和非专家标注者进行了连续和离散情感标注。我们以声学特征为基线,并使用基于 Transformer 的模型评估了说话人无关的 SER 模型。我们将结果与包含表演性语音和诱导性语音的参考数据集进行了比较,并分析了标注者和性别公平性的影响。预训练的 UniSpeech-SAT-Large 模型取得了最佳结果,在 EMOVOME 上的 3 分类效价和唤醒度预测中分别达到 61.64% 和 55.57% 的未加权准确率 (UA),比基线模型提升了 10%。在情感类别方面,获得了 42.58% 的 UA。EMOVOME 的表现低于表演性的 RAVDESS 数据集。诱导性的 IEMOCAP 数据集在预测情感类别方面也优于 EMOVOME,而在效价和唤醒度方面获得了相似的结果。EMOVOME 的结果随标注者标签而变化,结合专家和非专家标注时显示出更好的结果和公平性。本研究突出了受控场景与真实生活场景之间的差距,支持在识别真实情感方面的进一步发展。

关键词

引用

@article{arxiv.2403.02167,
  title  = {EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life Speech},
  author = {Lucía Gómez-Zaragozá and Rocío del Amor and María José Castro-Bleda and Valery Naranjo and Mariano Alcañiz Raya and Javier Marín-Morales},
  journal= {arXiv preprint arXiv:2403.02167},
  year   = {2024}
}

备注

This article is a merged version of the description of the EMOVOME database in arXiv:2402.17496v1 and the speech emotion recognition models in arXiv:2403.02167v1. This work has been submitted to the IEEE for possible publication