中文

kNN-SVC:基于加法合成和串联平滑优化的鲁棒零样本演唱语音转换

声音 2025-04-09 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

鲁棒性是零样本演唱语音转换(SVC)中的关键因素。本文引入了两种新方法来强化 kNN-VC 框架用于 SVC 的鲁棒性。首先,kNN-VC 的核心表示 WavLM 缺乏对谐波的强调,导致声音平淡且出现环颤伪影。为解决此问题,我们利用 WavLM、音高轮廓和声谱图之间的双射关系进行加法合成,将 resulting waveform 整合到模型中以缓解这些问题。其次,kNN-VC 忽略了串联平滑性,这是 SVC 中关键的感知因素。为增强平滑性,我们提出了一种新的距离度量方法,用于过滤出不适合的 kNN 候选者,并优化推理期间候选者的求和权重。虽然我们的技术建立在 kNN-VC 框架之上是为了实现便利的实现,但它们适用于通用的串联神经合成模型。实验结果验证了这些修改在实现稳健 SVC 方面的有效性。演示:https://knnsvc.com 代码:https://github.com/SmoothKen/knn-svc

关键词

引用

@article{arxiv.2504.05686,
  title  = {kNN-SVC: Robust Zero-Shot Singing Voice Conversion with Additive Synthesis and Concatenation Smoothness Optimization},
  author = {Keren Shao and Ke Chen and Matthew Baas and Shlomo Dubnov},
  journal= {arXiv preprint arXiv:2504.05686},
  year   = {2025}
}

备注

5 pages, 6 figures, 1 table, Proceedings of the International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2025