AISHELL-5:首个用于自动语音分离与识别的开源车载多通道多说话人语音数据集
声音
2025-05-30 v1 音频与语音处理
摘要
本文介绍了AISHELL-5,这是首个开源车载多通道多说话人中文自动语音识别(ASR)数据集。AISHLL-5包含两部分:(1)在电动汽车中跨越60多个真实驾驶场景录制的超过100小时的多通道语音数据。该音频数据由位于每个车门上的麦克风捕获的四个远场语音信号,以及每个说话人佩戴的高保真头戴式麦克风获取的近场信号组成。(2)40小时的真实环境噪声录音集合,用于支持车载语音数据仿真。此外,我们还提供了一个基于该数据集的开放、可复现的基线系统。该系统包含一个语音前端模型,采用语音源分离技术从远场信号中提取每个说话人的纯净语音,以及一个准确转录每个说话人内容的语音识别模块。实验结果展示了各种主流ASR模型在AISHELL-5上评估时面临的挑战。我们坚信,AISHELL-5数据集将通过建立首个公开可用的车载ASR基准,显著推进复杂驾驶场景下ASR系统的研究。
引用
@article{arxiv.2505.23036,
title = {AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition},
author = {Yuhang Dai and He Wang and Xingchen Li and Zihan Zhang and Shuiyuan Wang and Lei Xie and Xin Xu and Hongxiao Guo and Shaoji Zhang and Hui Bu and Wei Chen},
journal= {arXiv preprint arXiv:2505.23036},
year = {2025}
}
备注
5 pages, 1 figures, 3 tables, accepted by InterSpeech 2025