基于文本-only 微调的低资源领域自适应语音 LLM
音频与语音处理
2025-12-24 v2 计算与语言
摘要
近期自动语音识别(ASR)的进展将语音编码器与大语言模型(LLM)通过投影相结合,形成性能卓越的语音 LLM。然而,在数据稀缺的低资源场景下适配新领域仍具挑战性,尤其是缺乏配对的语音-文本数据。我们提出一种基于未配对目标域文本的文本-only 微调策略,用于语音 LLM的领域适应,无需额外音频数据。为保持语音-文本对齐,我们引入一种微调期间的实时评估机制。实验在 LibriSpeech、SlideSpeech 和 Medical 数据集上表明,本方法实现了具竞争力的识别性能,与完整音频-文本微调相比几乎没有性能下降。它还能在不发生灾难性遗忘的情况下提高对新领域的泛化能力,凸显了文本-only 微调在 ASR 低资源领域自适应中的潜力。
关键词
引用
@article{arxiv.2506.05671,
title = {Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning},
author = {Yangui Fang and Jing Peng and Xu Li and Yu Xi and Chengwei Zhang and Guohui Zhong and Kai Yu},
journal= {arXiv preprint arXiv:2506.05671},
year = {2025}
}
备注
This paper has been ACCEPTED for publication in ASRU