中文

OpusLM:开放统一语音语言模型家族

计算与语言 2025-06-25 v1 声音 音频与语音处理

摘要

本文提出了开放统一语音语言模型 (OpusLMs),这是一个规模最高达 7B 的开放基础语音语言模型 (SpeechLMs) 家族。OpusLMs 从仅解码器文本语言模型初始化,在 213K 小时的语音-文本对和 292B 个仅文本 token 上进行持续预训练。我们证明了 OpusLMs 在语音识别、语音合成和仅文本能力方面取得了与现有 SpeechLMs 相当(甚至更优)的性能。在技术上,本文阐述了我们在分词、多流语言模型和多阶段训练策略方面的 SpeechLM 设计。我们通过实验证明了模型规模扩展的重要性和退火数据选择的效果。OpusLMs 均使用公开可用材料构建,是完全透明的模型。我们发布了代码、数据、检查点和训练日志,以促进开放的 SpeechLM 研究。

关键词

引用

@article{arxiv.2506.17611,
  title  = {OpusLM: A Family of Open Unified Speech Language Models},
  author = {Jinchuan Tian and William Chen and Yifan Peng and Jiatong Shi and Siddhant Arora and Shikhar Bharadwaj and Takashi Maekaku and Yusuke Shinohara and Keita Goto and Xiang Yue and Huck Yang and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2506.17611},
  year   = {2025}
}