中文

SUTA-LM: 建立测试时适应与语言模型重排序之间的桥梁以提升 ASR 鲁棒性

计算与语言 2025-06-16 v1 人工智能 声音 音频与语音处理

摘要

尽管端到端语音识别(ASR)取得了进展,现实世界的领域不匹配仍导致性能下降。测试时适应(TTA)旨在通过在推理期间调整模型来缓解这一问题。最近的研究探索了将 TTA 与外部语言模型结合,采用如束搜索重排序或生成式纠错等技术。在本文中,我们识别出一种被忽视的挑战:TTA 可能干扰语言模型重排序,揭示了有效组合这两种方法的非平凡性。基于这一洞见,我们提出了 SUTA-LM,这是一种简单而有效的 SUTA(基于熵最小化的 TTA 方法)扩展,集成语言模型重排序。SUTA-LM 首先应用受控的适应过程,通过利用语音和语言信息的自动步长选择机制引导,然后进行语言模型重排序以细化输出。在18个多样化 ASR 数据集上的实验表明,SUTA-LM 在广泛领域范围内实现了稳健的性能。

关键词

引用

@article{arxiv.2506.11121,
  title  = {SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR},
  author = {Wei-Ping Huang and Guan-Ting Lin and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2506.11121},
  year   = {2025}
}