面向 ASR 可泛化口述语言理解的干预性语音噪声注入
计算与语言
2024-10-22 v1 声音
音频与语音处理
摘要
最近,预训练语言模型 (PLMs) 在口述语言理解 (SLU) 中受到广泛采用。然而,自动语音识别 (ASR) 系统常常产生不准确的转录文本,导致 SLU 模型接收到噪声输入,从而显著降低其性能。为此,本文旨在通过暴露 ASR 系统常见的噪声来训练能够抵抗 ASR 错误的 SLU 模型,这些噪声称为 ASR-可 plausibility 噪声。语音噪声注入 (SNI) 方法通过引入 ASR-可 plausibility 噪声来实现上述目标,但我们认为这些方法对特定 ASR 系统具有内在偏置,或针对 ASR 特定噪声。本文提出了一种新型且较不偏置的增强方法,通过切断噪声的非因果效应来引入任何 ASR 系统均可 plausibility 的噪声。实验结果和分析表明,所提方法在提升 SLU 模型对未知 ASR 系统的鲁棒性和可泛化性方面有效,尤其通过提前引入更多样化且 plausibility 的 ASR 噪声。
引用
@article{arxiv.2410.15609,
title = {Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding},
author = {Yeonjoon Jung and Jaeseong Lee and Seungtaek Choi and Dohyeon Lee and Minsoo Kim and Seung-won Hwang},
journal= {arXiv preprint arXiv:2410.15609},
year = {2024}
}
备注
9 pages, 3 figures