AzeroS:通过自生成无指令调谐扩展 LLM 到语音
计算与语言
2026-01-13 v1 声音
音频与语音处理
摘要
将大语言模型 (LLM) 扩展到语音领域最近获得了显著关注。典型方法通过投影模块将预训练的 LLM 与音频编码器连接起来,并在大规模特定于任务的指令调谐数据集上进行训练。然而,为特定需求 curate 这样的指令调谐数据是耗时的,而且在这种方式下训练的模型对未见任务的泛化能力往往较差。本文首先提出,语音-LLM 的最大泛化能力是在其使用自生成无指令调谐 (SIFT) 进行训练时实现的,其中监督信号是通过使用语音的文本表示作为输入的冻结 LLM 生成的。我们提出的 SIFT 范式消除了收集特定任务问答对的需求,yield 了对未见任务的最佳理论泛化。建立在该范式之上,我们引入了 AZeroS (Auden Zero-instruction-tuned Speech-LLM),其在约 25,000 小时带语音-文本对(包括约 3,000 小时带副语言标签的语音)的公开语料库中进行训练。基于 Qwen2.5-7B-Instruct,该模型仅更新两个轻量级投影模块(每个 2380 万参数),同时保持 LLM 和音频编码器冻结。尽管训练成本低且数据规模适中,AZeroS 在包括 VoiceBench、AIR-Bench Foundation (Speech) 和 AIR-Bench Chat (Speech) 在内的语义和副语言基准上实现了最先进的性能。
引用
@article{arxiv.2601.06086,
title = {AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning},
author = {Yiwen Shao and Wei Liu and Jiahong Li and Tianzi Wang and Kun Wei and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:2601.06086},
year = {2026}
}
备注
Technical Report