中文

LLaSO:用于大语言与语音模型可复现研究的基础框架

计算与语言 2025-08-22 v1 人工智能 机器学习 多媒体 声音

摘要

大语音语言模型(LSLMs)的发展因架构碎片化和缺乏透明度而受阻,阻碍了研究的系统性比较与可复现性。与视觉-语言领域不同,LSLM领域普遍存在仅发布模型权重而不附带对应训练数据和配置的做法。为解决这些关键缺口,我们引入了LLaSO——首个完全开放的大规模语音语言建模端到端框架。LLaSO为社区提供三项核心资源:(1)LLaSO-Align,一个包含1200万条实例的语音-文本对齐语料库;(2)LLaSO-Instruct,一个包含1350万条实例的多任务指令微调数据集;(3)LLaSO-Eval,一个用于标准化评估的可复现基准。为验证我们的框架,我们构建并发布了LLaSO-Base,一个仅基于我们的公开数据训练的38亿参数参考模型。它取得了0.72的归一化分数,建立了一个强大的、可复现的基线,超越了可比模型。我们的分析表明,虽然更广泛的训练覆盖提升了性能,但在未见过的任务上仍存在显著的泛化差距,特别是在纯音频场景中。通过发布完整的数据、基准和模型栈,LLaSO建立了统一研究努力和加速LSLM领域社区驱动进展的基础开放标准。我们在 https://github.com/EIT-NLP/LLaSO 发布了代码、数据集、预训练模型和结果。

关键词

引用

@article{arxiv.2508.15418,
  title  = {LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model},
  author = {Yirong Sun and Yizhong Geng and Peidong Wei and Yanjun Chen and Jinghan Yang and Rongfei Chen and Wei Zhang and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2508.15418},
  year   = {2025}
}