仅用最近邻的语音转换
音频与语音处理
2023-05-31 v1 计算与语言
声音
摘要
任意到任意语音转换旨在以目标说话人极少样本为参考,将源语音转换为目标嗓音。近期方法产生令人信服的转换,但代价是复杂性增加——使结果难以复现与拓展。相反,我们保持简单。我们提出 k-最近邻语音转换(kNN-VC):一种直接而有效的任意到任意转换方法。首先,我们提取源语音与参考语音的自监督表示。为转换至目标说话人,我们将源表示的每一帧替换为其于参考中的最近邻。最后,预训练声码器从转换后的表示合成音频。客观与主观评测表明,kNN-VC 在保持与现有方法相近可懂度得分的同时提升了说话人相似度。代码、样本、训练模型:https://bshall.github.io/knn-vc
引用
@article{arxiv.2305.18975,
title = {Voice Conversion With Just Nearest Neighbors},
author = {Matthew Baas and Benjamin van Niekerk and Herman Kamper},
journal= {arXiv preprint arXiv:2305.18975},
year = {2023}
}
备注
5 page, 1 table, 2 figures. Accepted at Interspeech 2023