中文

StoRIR:用于音频数据增强的随机房间脉冲响应生成

音频与语音处理 2020-08-18 v1 机器学习 声音

摘要

在本文中,我们介绍了 StoRIR——一种专用于机器学习应用中音频数据增强的随机房间脉冲响应生成方法。与镜像源或光线追踪等几何方法不同,该技术不需要预先定义房间几何形状、吸收系数或麦克风与声源位置,仅依赖于房间的声学参数。该方法直观、易于实现,并允许生成非常复杂封闭空间的房间脉冲响应(RIR)。我们表明,在语音增强任务中将 StoRIR 用于音频数据增强时,深度学习模型在广泛指标上比使用传统镜像源方法取得更好的结果,其中许多指标有效提升了 5% 以上。我们在线发布了 StoRIR 的 Python 实现。

关键词

引用

@article{arxiv.2008.07231,
  title  = {StoRIR: Stochastic Room Impulse Response Generation for Audio Data Augmentation},
  author = {Piotr Masztalski and Mateusz Matuszewski and Karol Piaskowski and Michał Romaniuk},
  journal= {arXiv preprint arXiv:2008.07231},
  year   = {2020}
}

备注

Accepted for INTERSPEECH 2020