AISHELL-4:面向会议场景下语音增强、分离、识别与说话人日志的开源数据集
声音
2021-08-11 v4 音频与语音处理
摘要
在本文中,我们提出 AISHELL-4,一个由 8 通道环形麦克风阵列采集的规模可观的真实录制普通话语音数据集,用于会议场景下的语音处理。该数据集包含 211 段会议录音,每段有 4 至 8 名说话人,总时长 120 小时。该数据集旨在从三个方面搭建多说话人处理前沿研究与实用应用场景之间的桥梁。借助真实录制的会议,AISHELL-4 提供了真实的声学环境及对话中丰富的自然语音特征,如短暂停顿、语音重叠、说话人快速切换、噪声等。同时,AISHELL-4 为每场会议提供了准确的转写与说话人语音活动标注。这使得研究者能够探索会议处理的各个方面,从语音前端处理、语音识别和说话人日志等独立任务,到多模态建模及相关任务的联合优化。鉴于大多数用于多说话人任务的开源数据集为英文,AISHELL-4 是唯一的对话语音普通话数据集,为语音界的数据多样性提供了额外价值。我们还发布了一个基于 PyTorch 的训练与评估框架作为基线系统,以促进该领域可复现的研究。
引用
@article{arxiv.2104.03603,
title = {AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario},
author = {Yihui Fu and Luyao Cheng and Shubo Lv and Yukai Jv and Yuxiang Kong and Zhuo Chen and Yanxin Hu and Lei Xie and Jian Wu and Hui Bu and Xin Xu and Jun Du and Jingdong Chen},
journal= {arXiv preprint arXiv:2104.03603},
year = {2021}
}
备注
Accepted by Interspeech 2021