中文

LibriheavyMix:一个用于单通道混响多说话人语音分离、自动语音识别和说话人日志的 20,000 小时数据集

声音 2024-09-04 v1 计算与语言 音频与语音处理

摘要

不断发展的语音处理领域越来越关注复杂场景,例如有多个同时说话人和远场条件的会议或鸡尾酒会。应对这些挑战的现有方法分为两类:多通道和单通道解决方案。单通道方法因其通用性和便利性而著称,不需要关于麦克风阵列的特定信息。本文提出了一个大规模远场重叠语音数据集,旨在推进语音分离、识别和说话人日志研究。该数据集是解码多说话人、混响环境中“谁在何时说了什么”这一领域内艰巨挑战的关键资源。此外,我们引入了一个包含语音分离、识别和日志的流水线系统作为基础基准。在 WHAMR! 数据集上的评估验证了所提出数据的广泛适用性。

关键词

引用

@article{arxiv.2409.00819,
  title  = {LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization},
  author = {Zengrui Jin and Yifan Yang and Mohan Shi and Wei Kang and Xiaoyu Yang and Zengwei Yao and Fangjun Kuang and Liyong Guo and Lingwei Meng and Long Lin and Yong Xu and Shi-Xiong Zhang and Daniel Povey},
  journal= {arXiv preprint arXiv:2409.00819},
  year   = {2024}
}

备注

InterSpeech 2024