中文

Spirit LM:交错式口语与书面语语言模型

计算与语言 2024-10-22 v2 声音 音频与语音处理

摘要

我们推出了 Spirit LM,这是一种能够自由混合文本与语音的基础多模态语言模型。我们的模型基于一个 7B 预训练文本语言模型,通过在文本和语音单元上进行持续训练,将其扩展至语音模态。语音序列与文本序列被拼接为单一的 token 流,并利用一个小型自动 curated 的语音 - 文本平行语料库,采用词级交错方法进行训练。Spirit LM 提供两个版本:Base 版本使用语音音素单元(HuBERT),Expressive 版本则在音素单元基础上引入音高和风格单元以建模表现力。两个版本中的文本均采用子词 BPE token 进行编码。所得模型兼具文本模型的语义能力与语音模型的表现力。此外,我们展示了 Spirit LM 能够以少样本方式跨模态学习新任务(即 ASR、TTS、语音分类)。我们公开了模型权重与推理代码。

关键词

引用

@article{arxiv.2402.05755,
  title  = {Spirit LM: Interleaved Spoken and Written Language Model},
  author = {Tu Anh Nguyen and Benjamin Muller and Bokai Yu and Marta R. Costa-jussa and Maha Elbayad and Sravya Popuri and Christophe Ropers and Paul-Ambroise Duquenne and Robin Algayres and Ruslan Mavlyutov and Itai Gat and Mary Williamson and Gabriel Synnaeve and Juan Pino and Benoit Sagot and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2402.05755},
  year   = {2024}
}