基于 kNN 检索的简单高效零样本多说话人文本转语音
音频与语音处理
2025-02-04 v3 人工智能
机器学习
声音
摘要
虽然近期的零样本多说话人文本转语音(TTS)模型取得了令人印象深刻的结果,但它们通常依赖于来自众多说话人的广泛转录语音数据集和复杂的训练流水线。与此同时,自监督学习(SSL)语音特征已成为 TTS 的有效中间表示。此外,来自不同说话人且线性接近的 SSL 特征在保持个体说话人身份的同时共享语音信息。在本研究中,我们提出了 kNN-TTS,一个简单高效的零样本多说话人 TTS 框架,利用检索方法借助 SSL 特征之间的线性关系。客观和主观评估表明,我们的模型仅使用来自单个说话人的转录语音进行训练,其性能即可与在显著更大的训练数据集上训练的最先进模型相媲美。低训练数据需求意味着 kNN-TTS 非常适合为低资源领域和语言开发多说话人 TTS 系统。我们还引入了一个插值参数,可实现细粒度的声音转换。演示样本可在 https://idiap.github.io/knn-tts 获取。
引用
@article{arxiv.2408.10771,
title = {kNN Retrieval for Simple and Effective Zero-Shot Multi-speaker Text-to-Speech},
author = {Karl El Hajal and Ajinkya Kulkarni and Enno Hermann and Mathew Magimai. -Doss},
journal= {arXiv preprint arXiv:2408.10771},
year = {2025}
}
备注
Accepted at NAACL 2025