中文

基于音频-文本语义奖励的 ASR 鲁棒性提升:测试时强化学习

声音 2026-03-06 v1 人工智能 机器学习

摘要

最近,ASR 系统(如 Whisper)已取得显著的准确率提升,但在面对真实世界未见数据(包括噪声环境和多样化语音方言)时仍高度敏感。为解决此问题,测试时适应(TTA)在提升推理时模型适应性方面显示出巨大的潜力,现有 TTA 方法通常依赖伪标签或熵最小化。然而,仅将模型置信度作为学习信号,这些方法可能强化高置信度的错误,从而导致 confirmation bias,削弱适应效果。为克服这些限制,我们提出了 ASR-TRA(ASR Test-time Reinforcement Adaptation),一种受因果干预启发的 novel framework。更具体地,我们的方法引入可学习的解码器提示符,并利用 temperature 控制的随机解码生成多样化转录候选选项。这些候选选项由衡量 audio-text 语义对齐的奖励模型评分,其反馈用于通过强化学习更新模型和提示符参数。在 LibriSpeech 上进行包含合成噪声和 L2 Arctic 方言英语数据集的全面实验表明,我们的方法在保持较低延迟的同时优于现有 TTA baseline 实现更高准确率。消融研究进一步确认了结合 audio 与 language 基于奖励的有效性,凸显了该方法在稳定性和可解释性方面的优势。总体而言,我们的方法为在挑战性真实世界环境中部署 ASR 系统提供了实用且鲁棒的解决方案。

关键词

引用

@article{arxiv.2603.05231,
  title  = {Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards},
  author = {Linghan Fang and Tianxin Xie and Li Liu},
  journal= {arXiv preprint arXiv:2603.05231},
  year   = {2026}
}