基于声学上下文条件化、语句嵌入与参考编码器的零样本文本语音编辑
声音
2022-10-31 v1 计算与语言
音频与语音处理
摘要
基于文本的语音编辑(TBVE)使用文本转语音(TTS)系统的合成输出来替换原始录音中的词语。近期工作已使用神经模型生成在清晰度、说话人身份和韵律方面与原始语音相似的编辑后语音。然而,先前工作的一个局限是使用微调来优化性能:这需要对来自目标说话人的数据进一步训练模型,是一个昂贵的过程,并可能将潜在敏感数据纳入服务器端模型。相比之下,本工作聚焦于完全避免微调的零样本方法,而是使用预训练的说话人验证嵌入以及联合训练的参考编码器来编码语句级信息,从而帮助捕捉说话人身份和韵律等方面。主观听测发现,在零样本设定下,语句嵌入与参考编码器均改善了编辑后合成语音与未编辑原始录音之间说话人身份与韵律的连续性。
引用
@article{arxiv.2210.16045,
title = {Towards zero-shot Text-based voice editing using acoustic context conditioning, utterance embeddings, and reference encoders},
author = {Jason Fong and Yun Wang and Prabhav Agrawal and Vimal Manohar and Jilong Wu and Thilo Köhler and Qing He},
journal= {arXiv preprint arXiv:2210.16045},
year = {2022}
}
备注
Submitted to ICASSP 2023