RIR-Mega-Speech:一个带有全面声学元数据和可复现评估的混响语音语料库
音频与语音处理
2026-01-29 v1 计算与语言
声音
信号处理
摘要
尽管对混响语音进行了数十年的研究,但比较方法仍然困难,因为大多数语料库缺乏每个文件的声学标注,或者提供的用于复现的文档有限。我们提出了RIR-Mega-Speech,一个约117.5小时的语料库,通过将LibriSpeech话语与来自RIR-Mega集合的大约5000个模拟房间脉冲响应进行卷积创建。每个文件都包含根据源RIR使用明确定义、可复现的程序计算的RT60、直达混响比(DRR)和清晰度指数()。我们还提供了重建数据集和复现所有评估结果的脚本。使用Whisper small模型在1500对话语上,我们测量到干净语音的词错误率(WER)为5.20%(95%置信区间:4.69--5.78),混响版本为7.70%(7.04--8.35),对应的配对增加为2.50个百分点(2.06--2.98)。这代表了48%的相对退化。WER随RT60单调增加,随DRR单调减少,这与先前的感知研究一致。虽然混响损害识别这一核心发现已得到充分证实,但我们旨在为社区提供一个标准化资源,其中声学条件透明,结果可以独立验证。该仓库包含适用于Windows和Linux环境的一键重建说明。
引用
@article{arxiv.2601.19949,
title = {RIR-Mega-Speech: A Reverberant Speech Corpus with Comprehensive Acoustic Metadata and Reproducible Evaluation},
author = {Mandip Goswami},
journal= {arXiv preprint arXiv:2601.19949},
year = {2026}
}