桥接稳定性与表达性差距:合成数据规模与偏好对齐用于低资源口语模型
计算与语言
2026-05-28 v1 人工智能
摘要
口语语言模型(SLMs)作为一种为语音合成提供新范式的模型正在不断涌现,然而其在低资源语言上的有效性基本受限于转录语音的稀缺。在实际应用中,合成数据已成为在资源不足的场景下扩展SLMs的主要策略,能够在真实数据不足时提供可靠的语音学监督。本文表明,这种依赖引入了一种根本性的权衡,我们称之为稳定性-表达性差距:尽管合成数据改善了语音学准确性,但它逐渐抑制了韵律变异性,最终导致表达性崩溃(合成侵蚀)。为弥合此差距,我们提出两种自对齐框架。解耦引导自对齐(DGSA)通过利用韵律-音色分离,恢复复杂语言的表达性。对于真实参考极其有限的场景,温度驱动自我批判(TDSC)通过自动化探索与过滤实现生成稳定性。我们的方法超越了强大的商业系统(包括ElevenLabs和Gemini Pro),并实现了对老挝语的首个零-shot语音克隆能力。
引用
@article{arxiv.2605.27383,
title = {Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models},
author = {Yizhong Geng and Yanliang Li and Jinghan Yang and Tianhan Jiang and Boxun An and Ya Li and Xiaoyu Shen},
journal= {arXiv preprint arXiv:2605.27383},
year = {2026}
}