中文

TS-RIR:用于语音增强的翻译合成房间脉冲响应

声音 2021-11-15 v5 音频与语音处理

摘要

我们提出一种提升合成房间脉冲响应质量以用于远场语音识别的方法。我们利用新颖的TS-RIRGAN架构弥合合成房间脉冲响应(RIR)与真实房间脉冲响应之间的保真度差距。给定以原始音频形式存在的合成RIR,我们使用TS-RIRGAN将其翻译为真实RIR。我们还对翻译后的合成RIR进行真实世界的子带房间均衡。我们的整体方法通过补偿低频波效应(类似于真实RIR中的效应)来提升合成RIR的质量。我们使用远场语音数据集评估改进合成RIR的性能,该数据集通过将LibriSpeech干净语音数据集[1]与RIR卷积并添加背景噪声来增强。我们表明,使用我们改进的合成RIR增强的远场语音在Kaldi远场自动语音识别基准[2]中将词错误率降低了至多19.9%。

关键词

引用

@article{arxiv.2103.16804,
  title  = {TS-RIR: Translated synthetic room impulse responses for speech augmentation},
  author = {Anton Ratnarajah and Zhenyu Tang and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2103.16804},
  year   = {2021}
}

备注

Accepted to IEEE ASRU 2021. Source code is available at https://github.com/GAMMA-UMD/TS-RIR