基于语法的空中交通管制语音识别说话人角色辨识
计算与语言
2022-12-15 v2 机器学习
音频与语音处理
摘要
空中交通管制的自动语音识别(ASR)通常将空中交通管制员(ATCO)和飞行员的数据混合为一个集合进行训练。其动机在于飞行员的语音通信比 ATCO 更为稀缺。由于这种数据不平衡及其他原因(例如变化的声学条件),ATCO 的语音通常比飞行员的语音识别更准确。自动辨识说话人角色是一项具有挑战性的任务,尤其是在使用甚高频(VHF)接收器采集的嘈杂录音中,或因缺少按键通话(PTT)信号(即两个音频通道混合)而无法获得该信号的情况下。在本工作中,我们提出(1)基于利用 ASR 转写文本的直观方法自动分割 ATCO 与飞行员数据,以及(2)随后将 ATCO 与飞行员的语音自动识别视为两项独立任务。我们的工作在具有高水平噪声的 VHF 音频数据上开展,即信噪比(SNR)低于 15 dB,因为该数据被认为有助于多种基于语音的机器学习任务。具体而言,对于说话人角色辨识任务,该模块由一个简单而高效的知识系统表示,该系统利用国际民用航空组织(ICAO)定义的语法。系统接受文本作为输入,可以是人工核验的标注或自动生成的转写文本。所提出的方法在说话人角色辨识上提供约 83% 的平均准确率。最后,我们表明,为 ASR 任务分别训练声学模型(即 ATCO 和飞行员使用独立模型)或采用多任务方法非常适用于噪声数据,并且优于将所有数据混合在一起的传统 ASR 系统。
引用
@article{arxiv.2108.12175,
title = {Grammar Based Speaker Role Identification for Air Traffic Control Speech Recognition},
author = {Amrutha Prasad and Juan Zuluaga-Gomez and Petr Motlicek and Saeed Sarfjoo and Iuliia Nigmatulina and Oliver Ohneiser and Hartmut Helmke},
journal= {arXiv preprint arXiv:2108.12175},
year = {2022}
}
备注
Presented at Sesar Innovation Days - 2022. See https://www.sesarju.eu/sesarinnovationdays