面向噪声语音识别的无训练 intelligibility 引导观察添加
音频与语音处理
2026-02-25 v1 人工智能
声音
摘要
自动语音识别 (ASR) 在噪声环境中性能恶化。尽管语音增强 (SE) 前端有效抑制背景噪声,但常会引入有害的伪影。观察添加 (OA) 通过融合噪声语音和 SE 增强语音来解决此问题,无需修改 SE 或 ASR 模型参数即可提升识别效果。本文提出一种以 intelligibility 为导向的 OA 方法,其中融合权重来源于来自后端 ASR 直接获取的 intelligibility 估计。不同于基于训练神经预测器的先前 OA 方法,所提方法无需训练,降低了复杂度并增强了泛化能力。广泛实验覆盖多种 SE-ASR 组合和数据集,证明方法具备强大的鲁棒性并优于现有 OA 基线。进一步分析了基于 intelligibility 引导的切换式备选方案以及帧级与句子级 OA 的差异,进一步验证了所提方案的设计合理性。
引用
@article{arxiv.2602.20967,
title = {Training-Free Intelligibility-Guided Observation Addition for Noisy ASR},
author = {Haoyang Li and Changsong Liu and Wei Rao and Hao Shi and Sakriani Sakti and Eng Siong Chng},
journal= {arXiv preprint arXiv:2602.20967},
year = {2026}
}