Libri-adhoc40:一个由同步自组织麦克风阵列采集的数据集
音频与语音处理
2021-04-08 v3
摘要
近来,关于自组织麦克风阵列的研究成为趋势。然而,大多数研究基于仿真数据进行。尽管已使用少量分布式设备采集了部分数据集,但它们未实现同步,这阻碍了自组织麦克风阵列的基础理论研究。为解决此问题,本文提出一个同步语音语料库,名为Libri-adhoc40,其在真实办公室环境中通过40个强同步分布式节点的自组织麦克风阵列,采集由扬声器播放的Librispeech数据。此外,为给语音前端处理及其他应用提供评估目标,我们还在消声室中录制了播放语音。我们在Libri-adhoc40数据集和仿真数据集上训练了若干多设备语音识别系统。实验结果证明了所提语料库的有效性,其可用作基准来反映具有不同自组织麦克风阵列的模型的趋势与差异。该数据集可在 https://github.com/ISmallFish/Libri-adhoc40 在线获取。
引用
@article{arxiv.2103.15118,
title = {Libri-adhoc40: A dataset collected from synchronized ad-hoc microphone arrays},
author = {Shanzheng Guan and Shupei Liu and Junqi Chen and Wenbo Zhu and Shengqiang Li and Xu Tan and Ziye Yang and Menglong Xu and Yijiang Chen and Jianyu Wang and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2103.15118},
year = {2021}
}