中文

一种用于语音增强与语音识别的半自发荷兰语语料库

音频与语音处理 2026-03-11 v1

摘要

我们提出 DRES:一个 1.5 小时的荷兰语真实挑选(半自发)语料库,来自 80 位说话人,录制于嘈杂的公共室内环境。DRES 旨在作为评估 SOTA 自动语音识别 (ASR) 和语音增强 (SE) 模型的测试集,以真实场景为背景:一个人在公共室内空间发言,伴随背景说话者和噪声。语音使用四通道线性麦克风阵列录制。本文评估了五种著名单通道 SE 算法的语音质量,以及八种 SOTA 离线 ASR 模型在应用 SE 前后的识别性能。我们发现尽管处于具有挑战性的条件,五个中的八个 ASR 模型在 DRES 上的词错误率 (WER) 低于 22%。与近期工作不同,我们未发现现代单通道 SE 对 ASR 性能的正面影响,这凸显了在真实条件下进行评估的重要性。

关键词

引用

@article{arxiv.2603.09725,
  title  = {A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition},
  author = {Dimme de Groot and Yuanyuan Zhang and Jorge Martinez and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2603.09725},
  year   = {2026}
}

备注

Submitted to Interspeech 2026