面向选择性可编辑文本到语音生成的统一神经编解码语言模型
声音
2026-01-21 v1 音频与语音处理
摘要
神经编解码语言模型通过完全模仿短语音提示的声学特征(包括音色、韵律和副语言信息),实现了令人印象深刻的零样本文本到语音(TTS)合成。然而,这种整体模仿限制了其隔离和控制单个属性的能力。在本文中,我们提出了一个统一的编解码语言模型SpeechEdit,它通过选择性控制机制扩展了零样本TTS。默认情况下,SpeechEdit再现从语音提示推断出的完整声学特征,但选择性地仅覆盖由显式控制指令指定的属性。为了实现可控建模,SpeechEdit在我们新构建的LibriEdit数据集上进行训练,该数据集提供了源自LibriHeavy的delta(差异感知)训练对。实验结果表明,我们的方法在保持自然度和鲁棒性的同时,提供了对所需属性的灵活且局部化的控制。音频样本可在https://speech-editing.github.io/speech-editing/获取。
引用
@article{arxiv.2601.12480,
title = {A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation},
author = {Hanchen Pei and Shujie Liu and Yanqing Liu and Jianwei Yu and Yuanhang Qian and Gongping Huang and Sheng Zhao and Yan Lu},
journal= {arXiv preprint arXiv:2601.12480},
year = {2026}
}