文本预训练的语音语言模型
计算与语言
2024-01-31 v3 机器学习
声音
音频与语音处理
摘要
语音语言模型(SpeechLM)仅处理并生成声学数据,无需文本监督。在这项工作中,我们提出 TWIST,一种利用预训练文本语言模型热启动来训练 SpeechLM 的方法。我们通过自动和人工评估表明,TWIST 全面优于冷启动的 SpeechLM。我们实证分析了不同模型设计选择的影响,如语音分词器、预训练文本模型以及数据集规模。我们发现模型和数据集规模在构建性能更好的 SpeechLM 中都起着重要作用。基于我们的观察,我们提出了(据我们所知)在参数数量和训练数据方面都是最大的 SpeechLM。此外,我们引入了 StoryCloze 文本基准的两个口语版本,以进一步改进模型评估并推动该领域的未来研究。我们公开了语音样本、代码和模型:https://pages.cs.huji.ac.il/adiyoss-lab/twist/ 。
引用
@article{arxiv.2305.13009,
title = {Textually Pretrained Speech Language Models},
author = {Michael Hassid and Tal Remez and Tu Anh Nguyen and Itai Gat and Alexis Conneau and Felix Kreuk and Jade Copet and Alexandre Defossez and Gabriel Synnaeve and Emmanuel Dupoux and Roy Schwartz and Yossi Adi},
journal= {arXiv preprint arXiv:2305.13009},
year = {2024}
}
备注
NeurIPS 2023