中文

EmoNet-Voice:面向语音情感检测的细粒度专家验证基准

计算与语言 2026-01-06 v3 人工智能

摘要

语音情感识别(SER)系统受到现有数据集的限制,这些数据集通常仅涵盖 6-10 种基本情感,缺乏规模和多样性,并且在收集敏感情感状态时面临伦理挑战。我们引入了 EMONET-VOICE,一个通过两个组成部分解决这些限制的综合性资源:(1)EmoNet-Voice Big,一个 5000 小时的多语言预训练数据集,涵盖 11 种声音和 4 种语言中的 40 个细粒度情感类别;(2)EmoNet-Voice Bench,一个经过严格验证的基准,包含 4700 个样本,在情感存在性和强度水平上获得一致专家共识。通过使用最先进的合成语音生成技术,我们的隐私保护方法能够在保持受控实验条件的同时实现对敏感情感(如疼痛、羞耻)的伦理包容。每个样本均经过三位心理学专家的验证。我们证明,在我们的合成数据上训练的共情洞察模型在真实世界数据集上实现了强大的泛化能力,在 EmoDB 和 RAVDESS 上进行了测试。此外,我们的全面评估揭示,虽然高唤醒情感(如愤怒:95% 准确率)易于检测,但该基准成功揭示了区分感知相似情感的难度(如悲伤与痛苦:63% 区分度),为推进精细情感 AI 提供了可量化的指标。EMONET-VOICE 为大规模、伦理来源的细粒度 SER 研究建立了新范式。

关键词

引用

@article{arxiv.2506.09827,
  title  = {EmoNet-Voice: A Fine-Grained, Expert-Verified Benchmark for Speech Emotion Detection},
  author = {Christoph Schuhmann and Robert Kaczmarczyk and Gollam Rabby and Felix Friedrich and Maurice Kraus and Kourosh Nadi and Huu Nguyen and Kristian Kersting and Sören Auer},
  journal= {arXiv preprint arXiv:2506.09827},
  year   = {2026}
}