基于深度学习的空中交通通信说话人角色识别对比研究
声音
2022-08-23 v2 计算与语言
音频与语音处理
摘要
空中交通管制(ATC)中管制员与飞行员对话的自动语音指令理解(SIU)不仅需要识别语音的词汇和语义,还需要确定说话人的角色。然而,已发表的空中交通通信自动理解系统研究中,鲜有工作关注说话人角色识别(SRI)。本文将管制员-飞行员通信的 SRI 任务形式化为一个二分类问题。此外,提出了基于文本、基于语音以及基于语音和文本的多模态方法,以实现对 SRI 任务的全面比较。为消融不同对比方法的影响,应用了多种先进的神经网络架构来优化基于文本和基于语音方法的实现。最重要的是,设计了一个多模态说话人角色识别网络(MMSRINet),通过同时考虑语音和文本模态特征来完成 SRI 任务。为聚合模态特征,提出了模态融合模块,分别通过模态注意力机制和自注意力池化层来融合并压缩声学和文本表征。最后,在采集自真实 ATC 环境的 ATCSpeech 语料库上验证了这些对比方法。实验结果表明,所有对比方法均能有效完成 SRI 任务,且所提出的 MMSRINet 在已知和未知数据上均表现出优于其他方法的竞争性能和鲁棒性,准确率分别达到 98.56% 和 98.08%。
引用
@article{arxiv.2111.02041,
title = {A Comparative Study of Speaker Role Identification in Air Traffic Communication Using Deep Learning Approaches},
author = {Dongyue Guo and Jianwei Zhang and Bo Yang and Yi Lin},
journal= {arXiv preprint arXiv:2111.02041},
year = {2022}
}
备注
This work has been submitted to the ACM TALLIP for possible publication