中文

DC-Spin:面向口语语言模型的说话人不变语音标记器

音频与语音处理 2024-11-01 v1 计算与语言 机器学习 声音

摘要

口语语言模型(SLM)随着基于文本的解码器-only语言模型的进步而受到越来越多的关注。SLM处理文本和语音,实现同时的语音理解和生成。本文提出双码本说话人不变聚类(DC-Spin),旨在通过桥接音频信号和SLM标记来改进语音标记化。DC-Spin提取富含语音信息且对输入变化具有鲁棒性的说话人不变标记,增强零样本SLM任务和语音重合成。我们提出一种分块方法以实现可流式处理的DC-Spin而无需重新训练且不降级。与标记化方法(自监督和神经音频编解码器)、模型可扩展性以及下游任务代理的比较表明,易于用n-gram语言模型建模或与音素对齐的标记具有强劲性能,为设计SLM的语音标记化提供了见解。

关键词

引用

@article{arxiv.2410.24177,
  title  = {DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models},
  author = {Heng-Jui Chang and Hongyu Gong and Changhan Wang and James Glass and Yu-An Chung},
  journal= {arXiv preprint arXiv:2410.24177},
  year   = {2024}
}

备注

Preprint