中文

仅用最近邻的语音转换

音频与语音处理 2023-05-31 v1 计算与语言 声音

摘要

任意到任意语音转换旨在以目标说话人极少样本为参考,将源语音转换为目标嗓音。近期方法产生令人信服的转换,但代价是复杂性增加——使结果难以复现与拓展。相反,我们保持简单。我们提出 k-最近邻语音转换(kNN-VC):一种直接而有效的任意到任意转换方法。首先,我们提取源语音与参考语音的自监督表示。为转换至目标说话人,我们将源表示的每一帧替换为其于参考中的最近邻。最后,预训练声码器从转换后的表示合成音频。客观与主观评测表明,kNN-VC 在保持与现有方法相近可懂度得分的同时提升了说话人相似度。代码、样本、训练模型:https://bshall.github.io/knn-vc

关键词

引用

@article{arxiv.2305.18975,
  title  = {Voice Conversion With Just Nearest Neighbors},
  author = {Matthew Baas and Benjamin van Niekerk and Herman Kamper},
  journal= {arXiv preprint arXiv:2305.18975},
  year   = {2023}
}

备注

5 page, 1 table, 2 figures. Accepted at Interspeech 2023