SLM-TTA:一个面向生成式口语语言模型的测试时自适应框架
声音
2026-01-01 v1
摘要
口语语言模型 (SLMs) 在现代语音驱动应用中日益占据核心地位,但其性能在声学偏移(真实世界的噪声、混响和麦克风差异)下会下降。先前的解决方案依赖于离线领域自适应,这是事后、数据密集且缓慢的。我们为处理交错音频-文本提示的生成式 SLMs 引入了首个测试时自适应 (TTA) 框架。我们的方法在推理过程中仅使用传入的语音片段来更新一小部分、有针对性的参数,无需任何源数据或标签。这稳定了词元分布,并提高了对声学变异性的鲁棒性,同时不降低核心任务的准确性。在自动语音识别、语音翻译以及来自 AIR-Bench 的 19 个音频理解任务上进行的评估表明,我们的方法在多种失真下均能带来一致的增益。由于自适应仅触及一小部分权重,因此它在计算和内存上都是高效的,支持在资源受限的平台上的部署。这项工作增强了生成式口语语言模型在真实世界语音驱动应用中的鲁棒性和自适应性。
引用
@article{arxiv.2512.24739,
title = {SLM-TTA: A Framework for Test-Time Adaptation of Generative Spoken Language Models},
author = {Yuan-Kuei Wu and Yang Liu and Yiteng Huang and Zhaojun Yang and Haibin Wu and Ruizhe Huang and Yi-Te and Hsu and Shuyu Kong and Ming Sun and Florian Metze and Li Wan},
journal= {arXiv preprint arXiv:2512.24739},
year = {2026}
}