联合与顺序说话人-角色检测与自动语音识别:空中交通管控场景
计算与语言
2024-06-21 v1 声音
音频与语音处理
摘要
利用空中交通管控(ATC)数据进行下游自然语言处理任务需要进行预处理步骤。关键步骤包括通过自动语音识别(ASR)对数据进行转录,以及说话人分割(speaker diarization),即检测说话人角色(SRD)以将转录文本划分为飞行员和空中交通管控员(ATCO)的文本。虽然传统方法会分别处理这些任务,但我们提出了一种基于Transformer的联合ASR-SRD系统,通过标准的ASR架构联合解决两个任务。我们将该联合系统与两种级联式ASR和SRD方法进行比较,并在多个ATC数据集上进行测试。我们的研究显示,在何种情况下联合系统可以超越两种传统方法,以及在何种情况下其他体系结构更为可取。我们还评估了声学和词汇差异对所有体系结构的影响,并展示了如何为我们的联合体系结构克服这些差异。
引用
@article{arxiv.2406.13842,
title = {Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control},
author = {Alexander Blatt and Aravind Krishnan and Dietrich Klakow},
journal= {arXiv preprint arXiv:2406.13842},
year = {2024}
}
备注
Accepted at Interspeech 2024