BERSting at the Screams:一种距离性、情感和大喊语音识别基准
计算与语言
2025-07-31 v2 声音
音频与语音处理
摘要
一些语音识别任务,如自动语音识别(ASR),在许多报告指标上已接近或达到人类水平。然而,在复杂现实场景中仍然难以应对,如远距离语音识别。以往挑战发布数据集以解决距离问题,但关注点仍主要集中于距离, Specifically 依赖多麦克风阵列系统。我们提出B(asic)E(motion)R(andom phrase)S(hou)t(s)(BERSt)数据集。该数据集包含来自98位演员的近4小时英语语音,演员声音具有不同地区和非母语 accent。数据在演员居家环境中使用智能手机收集,包含至少98种不同的声学环境。数据还包括7种不同的情感提示以及喊叫和正常语音。智能手机放置在19个不同位置,包括障碍物以及演员房间之外的位置。该数据公开可供使用,可用于评估各种语音识别任务,包括ASR、喊叫检测和语音情感识别(SER)。我们提供了ASR和SER任务的初始基准,发现ASR在距离增加和喊叫程度提升时性能下降,并且根据意图情感表现出差异。我们的结果表明,BERSt数据集对ASR和SER任务都具有挑战性,仍需进一步工作以提高此类系统在更准确的现实应用中的鲁棒性。
引用
@article{arxiv.2505.00059,
title = {BERSting at the Screams: A Benchmark for Distanced, Emotional and Shouted Speech Recognition},
author = {Paige Tuttösí and Mantaj Dhillon and Luna Sang and Shane Eastwood and Poorvi Bhatia and Quang Minh Dinh and Avni Kapoor and Yewon Jin and Angelica Lim},
journal= {arXiv preprint arXiv:2505.00059},
year = {2025}
}
备注
Accepted to Computer Speech and Language, Special issue: Multi-Speaker, Multi-Microphone, and Multi-Modal Distant Speech Recognition. Project Webpage and Data access : https://huggingface.co/datasets/Rosie-Lab/BERSt