有限语音数据下大规模音频语言模型微调用于口语理解的研究
声音
2026-01-22 v2 计算与语言
机器学习
音频与语音处理
摘要
大规模音频语言模型(LALMs)已成为语音相关任务的强大工具,但针对微调的探索仍然不足,尤其是在有限语音数据的情况下。为了弥补这一差距,我们系统地研究了不同微调方案(包括仅文本、直接混合和课程学习)如何影响口语理解(SLU),重点关注文本-标签对丰富而配对语音-标签数据有限的场景。结果表明,LALMs 通过仅文本微调已经取得了具有竞争力的性能,突显了其强大的泛化能力。即使添加少量语音数据(2-5%)也能带来显著的进一步提升,而课程学习在数据稀缺时尤为有效。在跨语言 SLU 中,结合源语言语音数据、目标语言文本和少量目标语言语音数据可以实现有效适配。总体而言,本研究为真实数据约束下的 LALM 微调提供了实用见解。
引用
@article{arxiv.2509.15389,
title = {Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data},
author = {Youngwon Choi and Jaeyoon Jung and Hyeonyu Kim and Huu-Kim Nguyen and Hwayeon Kim},
journal= {arXiv preprint arXiv:2509.15389},
year = {2026}
}
备注
4 pages (excluding references), 2 figures, ICASSP 2026 (Accepted)