ATCSpeech:来自真实空中交通管制环境的多语言管制员-飞行员语音语料库
计算与语言
2021-02-17 v1 声音
音频与语音处理
摘要
自动语音识别(ASR)近年来发展迅速,推动了诸多其他领域的应用。对于ASR研究而言,语音语料库始终是重要的基础,尤其是针对空中交通管制(ATC)等垂直行业。现有一些用于通用应用的语音语料库,或公开或付费。然而,由于安全问题,ATC领域难以从真实系统中采集原始语音。更为重要的是,对于ASR这类监督学习任务,标注转写文本是一项更为繁重的工程,极大限制了ASR应用的前景。本文构建并发布了一个来自真实ATC系统的多语言语音语料库(ATCSpeech),包含带口音的汉语普通话与英语,旨在促进ATC领域的非商业ASR研究。我们从数据量、说话人性别与角色、语音质量及其他属性等方面详细介绍了该语料库。此外,我们还报告了基线ASR模型的性能。我们的语音数据库社区版可在特定协议下申请和使用。据我们所知,这是首个旨在为航空交通相关研究构建真实多语言ASR语料库的工作。
引用
@article{arxiv.1911.11365,
title = {ATCSpeech: a multilingual pilot-controller speech corpus from real Air Traffic Control environment},
author = {Bo Yang and Xianlong Tan and Zhengmao Chen and Bing Wang and Dan Li and Zhongping Yang and Xiping Wu and Yi Lin},
journal= {arXiv preprint arXiv:1911.11365},
year = {2021}
}