一种针对 ASR 准确率优化的基于 Conformer 的波形域神经声学回声消除器
音频与语音处理
2022-05-10 v1 声音
信号处理
摘要
声学回声消除(AEC)对于准确识别正在播放音频的智能音箱所听到的查询语句至关重要。先前的研究表明,在 log-mel 谱特征(以下记为“logmel”)上运行的神经 AEC 模型,若利用预训练 ASR 模型编码器通过辅助损失进行优化,可大幅提升自动语音识别(ASR)准确率。本文受“TasNet”架构启发,开发了一种基于 conformer 的波形域神经 AEC 模型。该模型通过在大型语音数据集上联合优化负尺度不变信噪比(SISNR)与 ASR 损失进行训练。在一个真实的重录测试集上,我们发现级联线性自适应 AEC 与波形域神经 AEC 非常有效,相较单独使用线性 AEC 可降低 56–59% 的词错误率(WER)。在该测试集上,这一参数量为 1.6M 的波形域神经 AEC 在简易至中等条件下,也比参数量更大的 6.5M logmel 域神经 AEC 模型提升 20–29%。由于在小帧上运算,该波形神经模型在较小规模下表现更优,更适用于内存受限的应用场景。
引用
@article{arxiv.2205.03481,
title = {A Conformer-based Waveform-domain Neural Acoustic Echo Canceller Optimized for ASR Accuracy},
author = {Sankaran Panchapagesan and Arun Narayanan and Turaj Zakizadeh Shabestary and Shuai Shao and Nathan Howard and Alex Park and James Walker and Alexander Gruenstein},
journal= {arXiv preprint arXiv:2205.03481},
year = {2022}
}
备注
Submitted to Interspeech 2022