中文

神经拼接式歌声转换:重新思考基于拼接的方法用于单样本歌声转换

声音 2024-01-09 v2 音频与语音处理

摘要

任意到任意歌声转换面临着因内容与说话人音色解耦不充分而导致的“音色泄漏”问题挑战。为了解决这个问题,本研究引入了 NeuCoSVC,一种新颖的神经拼接式 SVC 框架。它由一个自监督学习表示提取器、一个神经谐波信号发生器和一个波形合成器组成。SSL 提取器将音频压缩为固定维度的 SSL 特征,而谐波信号发生器利用线性时变滤波器产生原始和滤波后的谐波信号以获取音高信息。合成器使用 SSL 特征、谐波信号和响度信息重建波形。在推理过程中,通过将源 SSL 特征替换为匹配池中与其最接近的对应特征来执行语音转换,该匹配池包含从参考音频中提取的 SSL 特征,同时保留源音频的原始谐波信号和响度。通过直接利用参考音频的 SSL 特征,所提出的框架有效解决了先前基于解耦方法引起的“音色泄漏”问题。实验结果表明,在跨语言、跨语言和跨域评估的单样本 SVC 中,所提出的 NeuCoSVC 系统优于基于解耦的说话人嵌入方法。

关键词

引用

@article{arxiv.2312.04919,
  title  = {Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion},
  author = {Binzhu Sha and Xu Li and Zhiyong Wu and Ying Shan and Helen Meng},
  journal= {arXiv preprint arXiv:2312.04919},
  year   = {2024}
}