中文

Treble10:用于远场语音识别、脱回声与增强的高质量数据集

音频与语音处理 2025-10-28 v1 机器学习

摘要

准确的远场语音数据集对自动语音识别(ASR)、脱回声、语音增强和声源分离等任务至关重要。然而,当前的数据集在声学真实性和可扩展性之间存在权衡。测量数据集能提供忠实的物理建模,但成本高昂、覆盖范围有限,且很少包含干净语音与回声语音的配对数据。相比之下,大多数基于仿真的数据集依赖于简化的几何声学模型,因而未能再现支配复杂环境中声传播的衍射、散射和干涉等关键物理现象。我们引入 Treble10,这是一个大规模、在物理上准确的房间声数据集。Treble10 包含超过 3000 个宽带房间脉冲响应(RIR),这些 RIR 在 10 个完全家具化的真实房间中仿真生成,采用在 Treble SDK 中实现的混合仿真范式,结合波基方法和几何声学求解器。该数据集提供六个互补子集,涵盖单声道、8 阶 Ambisonics 和 6 声道设备 RIR,以及与 LibriSpeech 语音片段配对的回声语音场景。所有信号均以 32 kHz 采样,准确地模拟了低频波动作用和高频反射。Treble10 弥合了测量仿真之间的真实性鸿沟,为远场语音任务提供可复现、以物理为基础的评估和大规模数据增强。该数据集通过 Hugging Face Hub 公开提供,旨作为基准和下一代仿真驱动音频研究的模板。

关键词

引用

@article{arxiv.2510.23141,
  title  = {Treble10: A high-quality dataset for far-field speech recognition, dereverberation, and enhancement},
  author = {Sarabeth S. Mullins and Georg Götz and Eric Bezzam and Steven Zheng and Daniel Gert Nielsen},
  journal= {arXiv preprint arXiv:2510.23141},
  year   = {2025}
}