中文

一种针对 ASR 准确率优化的基于 Conformer 的波形域神经声学回声消除器

音频与语音处理 2022-05-10 v1 声音 信号处理

摘要

声学回声消除(AEC)对于准确识别正在播放音频的智能音箱所听到的查询语句至关重要。先前的研究表明,在 log-mel 谱特征(以下记为“logmel”)上运行的神经 AEC 模型,若利用预训练 ASR 模型编码器通过辅助损失进行优化,可大幅提升自动语音识别(ASR)准确率。本文受“TasNet”架构启发,开发了一种基于 conformer 的波形域神经 AEC 模型。该模型通过在大型语音数据集上联合优化负尺度不变信噪比(SISNR)与 ASR 损失进行训练。在一个真实的重录测试集上,我们发现级联线性自适应 AEC 与波形域神经 AEC 非常有效,相较单独使用线性 AEC 可降低 56–59% 的词错误率(WER)。在该测试集上,这一参数量为 1.6M 的波形域神经 AEC 在简易至中等条件下,也比参数量更大的 6.5M logmel 域神经 AEC 模型提升 20–29%。由于在小帧上运算,该波形神经模型在较小规模下表现更优,更适用于内存受限的应用场景。

关键词

引用

@article{arxiv.2205.03481,
  title  = {A Conformer-based Waveform-domain Neural Acoustic Echo Canceller Optimized for ASR Accuracy},
  author = {Sankaran Panchapagesan and Arun Narayanan and Turaj Zakizadeh Shabestary and Shuai Shao and Nathan Howard and Alex Park and James Walker and Alexander Gruenstein},
  journal= {arXiv preprint arXiv:2205.03481},
  year   = {2022}
}

备注

Submitted to Interspeech 2022