中文

用于语音推测解码的原则性粗粒度接受方法

音频与语音处理 2026-01-23 v4 机器学习

摘要

推测解码通过让一个快速的草稿模型提出词元,再由一个更大的目标模型进行验证,来加速自回归语音生成。然而,对于生成声学词元的语音 LLM,精确的词元匹配过于严格:许多离散词元在声学或语义上是可以互换的,这降低了接受率并限制了加速效果。我们引入了原则性粗粒度化(PCG),它在从目标模型嵌入空间导出的声学相似组(ASG)层面验证提议。通过将每个词元的概率质量拆分到包含它的重叠组上,我们定义了一个重叠感知的粗粒度分布,并对得到的组变量进行拒绝采样。这在组层面产生了精确性保证,同时允许被接受的草稿词元在实践中代表该组中的任何成员。在 LibriTTS 上,相对于标准推测解码和先前的语音特定松弛方法,PCG 提高了接受率和吞吐量,同时保持了可懂度和说话人相似度。这些结果表明,声学感知的组级接受是一种简单且通用的方法,可在保持语音质量的同时加速语音词元生成。

关键词

引用

@article{arxiv.2511.13732,
  title  = {Principled Coarse-Grained Acceptance for Speculative Decoding in Speech},
  author = {Moran Yanuka and Paul Dixon and Eyal Finkelshtein and Daniel Rotman and Raja Giryes},
  journal= {arXiv preprint arXiv:2511.13732},
  year   = {2026}
}

备注

Accepted to ICASSP 2026