中文

GenTSE: 通过从粗到细的生成式语言模型增强目标说话人提取

音频与语音处理 2025-12-25 v1 人工智能 机器学习

摘要

基于语言模型(LM)的生成式建模已成为目标说话人提取(TSE)的一个有前景的方向,有望提升泛化能力和高保真语音。我们提出 GenTSE,一种用于 TSE 的两阶段仅解码器生成式语言模型方法:第一阶段预测粗粒度语义令牌,第二阶段生成细粒度声学令牌。分离语义和声学信息稳定了解码过程,并产生更忠实、内容对齐的目标语音。两个阶段都使用连续的 SSL 或编解码器嵌入,相比离散化提示方法提供了更丰富的上下文。为减少曝光偏差,我们采用了一种冻结语言模型条件训练策略,该策略基于早期检查点的预测令牌来条件化语言模型,以缩小教师强制训练与自回归推理之间的差距。我们进一步采用 DPO 来更好地使输出与人类感知偏好对齐。在 Libri2Mix 上的实验表明,GenTSE 在语音质量、可懂度和说话人一致性方面超越了先前的基于语言模型的系统。

关键词

引用

@article{arxiv.2512.20978,
  title  = {GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model},
  author = {Haoyang Li and Xuyi Zhuang and Azmat Adnan and Ye Ni and Wei Rao and Shreyas Gopal and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2512.20978},
  year   = {2025}
}