中文

联合与顺序说话人-角色检测与自动语音识别:空中交通管控场景

计算与语言 2024-06-21 v1 声音 音频与语音处理

摘要

利用空中交通管控(ATC)数据进行下游自然语言处理任务需要进行预处理步骤。关键步骤包括通过自动语音识别(ASR)对数据进行转录,以及说话人分割(speaker diarization),即检测说话人角色(SRD)以将转录文本划分为飞行员和空中交通管控员(ATCO)的文本。虽然传统方法会分别处理这些任务,但我们提出了一种基于Transformer的联合ASR-SRD系统,通过标准的ASR架构联合解决两个任务。我们将该联合系统与两种级联式ASR和SRD方法进行比较,并在多个ATC数据集上进行测试。我们的研究显示,在何种情况下联合系统可以超越两种传统方法,以及在何种情况下其他体系结构更为可取。我们还评估了声学和词汇差异对所有体系结构的影响,并展示了如何为我们的联合体系结构克服这些差异。

关键词

引用

@article{arxiv.2406.13842,
  title  = {Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control},
  author = {Alexander Blatt and Aravind Krishnan and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2406.13842},
  year   = {2024}
}

备注

Accepted at Interspeech 2024