中文

ROSE:空中交通管制中基于多目标学习的识别导向语音增强框架

声音 2024-07-31 v2 人工智能

摘要

无线电语音回声是空中交通管制(ATC)领域的一种特有现象,它会降低语音质量,进而影响自动语音识别(ASR)的准确率。本文提出了一种时域识别导向语音增强(ROSE)框架,该框架基于卷积编码器-解码器结构的U-Net架构,旨在提升语音可懂度并提高ASR准确率,可作为ATC场景中的即插即用工具,无需对ASR模型进行额外重训练。具体而言:1)在U-Net架构中,应用了基于注意力的跳跃融合(ABSF)模块,利用注意力掩码从编码器中挖掘共享特征,使模型能够有效融合层次化特征。2)创新性地设计了通道与序列注意力(CSAtt)模块,在双并行注意力路径中引导模型关注信息性特征,旨在增强有效表示并抑制干扰噪声。3)基于手工设计的特征,设计了面向ASR的优化目标,通过学习鲁棒的特征表示来提升ATC环境下的识别性能。通过结合面向语音增强和面向ASR的损失,ROSE以多目标学习的方式实现,优化跨两个任务目标的共享表示。实验结果表明,ROSE在语音增强和ASR任务上均显著优于其他最先进的方法,其中所有提出的改进均通过设计实验得到证实。此外,所提出的方法能够在公开数据集上贡献期望的性能提升。

关键词

引用

@article{arxiv.2312.06118,
  title  = {ROSE: A Recognition-Oriented Speech Enhancement Framework in Air Traffic Control Using Multi-Objective Learning},
  author = {Xincheng Yu and Dongyue Guo and Jianwei Zhang and Yi Lin},
  journal= {arXiv preprint arXiv:2312.06118},
  year   = {2024}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing