基于分解最优传输的无训练语音转换
声音
2025-06-12 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
本文引入 Factorized MKL-VC,一种针对 kNN-VC 流水线的无训练修改方案。与原始流水线不同,本算法仅需 5 秒参考音频,即可实现高质量的任意到任意跨语言语音转换。MKL-VC 将 kNN 回归替换为从 WavLM 嵌入子空间中派生的分解最优传输图,该图源自 Monge-Kantorovich 线性解。分解技术解决了不同维度中方差不均的问题,确保有效的特征转换。在 LibriSpeech 和 FLEURS 数据集上的实验表明,MKL-VC 在短参考音频下显著提升了内容保真度和鲁棒性,超越了 kNN-VC。MKL-VC 的性能在跨语言语音转换领域达到与 FACodec 相当。
引用
@article{arxiv.2506.09709,
title = {Training-Free Voice Conversion with Factorized Optimal Transport},
author = {Alexander Lobashev and Assel Yermekova and Maria Larchenko},
journal= {arXiv preprint arXiv:2506.09709},
year = {2025}
}
备注
Interspeech 2025