Flow-SLM:用于口语语言建模的语言与声学信息联合学习
计算与语言
2025-10-23 v3
摘要
无文本口语语言模型(SLM)是不依赖文本监督的语音生成模型。大多数无文本 SLM 学习预测下一个语义 token,即语言内容的离散表示,并依赖单独的声码器将声学信息添加到生成的语音中。此类模型无法访问声学上下文,也无法对声学细节进行内置控制。在这项工作中,我们提出通过生成语义 token 和声学帧的连续实值表示来联合建模语言和声学信息。我们使用流匹配目标来预测以语义 token 为条件的连续向量。我们研究了这种方法的设计空间,并发现预测多个未来语义 token 有助于保留语言信息。我们的方法在语言似然基准测试方面实现了与现有模型相当的性能,同时在提示生成中提供了更好的声学细节。
引用
@article{arxiv.2508.09350,
title = {Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling},
author = {Ju-Chieh Chou and Jiawei Zhou and Karen Livescu},
journal= {arXiv preprint arXiv:2508.09350},
year = {2025}
}
备注
ASRU 2025. Project page: https://jjery2243542.github.io/flowslm.github.io/