中文

利用无标签语音提升音频大语言模型的自我改进

声音 2025-07-29 v1 音频与语音处理

摘要

近期音频大语言模型快速涌现,展示出在各种语音任务上强大的泛化能力。然而,鉴于语音信号的内在复杂性,这些模型不可避免地会在特定目标领域出现性能下降。为此,我们聚焦于在没有任何标记数据的情况下提升音频大语言模型在目标领域的性能。我们提出一种称为 SI-SDA 的自我改进方法,利用大模型解码中嵌入的信息来评估生成伪标签的质量,然后基于强化学习优化进行领域适应。实验结果表明,我们的方法在自动语音识别(ASR)、口语问答(SQA)和语音到文本翻译(S2TT)等多个公开数据集上 consistently and显著地提升了音频大语言模型的性能。此外,我们的方法在数据效率方面表现出色,凸显了其在实际部署中的潜力。

关键词

引用

@article{arxiv.2507.20169,
  title  = {Self-Improvement for Audio Large Language Model using Unlabeled Speech},
  author = {Shaowen Wang and Xinyuan Chen and Yao Xu},
  journal= {arXiv preprint arXiv:2507.20169},
  year   = {2025}
}

备注

To appear in Interspeech 2025. 6 pages, 1 figure