面向声学一致性的语音语言模型优化
计算与语言
2025-10-01 v1 声音
摘要
我们研究结合语义初始化与规划损失以实现稳健且一致生成的语音语言模型。我们的方法用自监督特征初始化语音 token,施加轻量对齐损失,并以稀疏化和针对鲁棒性与内容规划的辅助目标进行训练。我们训练了三个模型:一个 0.7B 纯语音模型、一个 1.0B 纯语音模型,以及一个同时包含文本与语音的 1.0B 交错模型。声学研究表明,纯语音模型在说话人、性别、情感、房间和背景因素上实现了最高的一致性,超越了更大的系统。交错建模提升了词汇与句法探测以及语义-声学对齐,但降低了一致性。线性探测表明,我们的初始化使模型偏向内容结构,但以牺牲韵律细节为代价。这些结果表明,语言模型侧的设计与训练组合能够控制声学稳定性与语义基础之间的平衡,而无需更改 tokenizer 或运行时架构。演示与模型权重已公开供探索。
引用
@article{arxiv.2509.26276,
title = {Optimizing Speech Language Models for Acoustic Consistency},
author = {Morteza Rohanian and Michael Krauthammer},
journal= {arXiv preprint arXiv:2509.26276},
year = {2025}
}