中文

Slamming:单GPU 24小时内训练语音语言模型

机器学习 2025-05-23 v2 人工智能 计算与语言 声音 音频与语音处理

摘要

我们提出Slam,这是一套在单块学术GPU上24小时内训练高质量语音语言模型(Speech Language Model, SLM)的配方。为此,我们通过对模型初始化和架构、合成训练数据、基于合成数据的偏好优化以及调整所有其他组件的经验性分析,实现了上述目标。我们经验性地证明,这种训练配方在更多计算资源可用时也能良好扩展,能够以更少的计算成本获得与领先SLM相当的效果。我们希望这些见解能够使SLM的训练与研究更加可及。在语音语言模型扩展规律的背景下,我们的结果远超预测的计算最优性能,为SLM的可行性提供了乐观的前景。详见代码、数据、模型和样本:https://pages.cs.huji.ac.il/adiyoss-lab/slamming

关键词

引用

@article{arxiv.2502.15814,
  title  = {Slamming: Training a Speech Language Model on One GPU in a Day},
  author = {Gallil Maimon and Avishai Elmakies and Yossi Adi},
  journal= {arXiv preprint arXiv:2502.15814},
  year   = {2025}
}

备注

ACL 2025 (Findings)