中文

使用基于自监督表示的旋律特征进行带伴奏的歌声转换

声音 2025-02-10 v1 机器学习 音频与语音处理

摘要

旋律保留在歌声转换 (SVC) 中至关重要。然而,在许多场景中,音频常伴有背景音乐 (BGM),这可能导致音频失真并干扰旋律及其他关键特征的提取,从而显著降低 SVC 性能。先前的方法尝试通过使用更鲁棒的基于神经网络的旋律提取器来解决此问题,但在复杂伴奏下其性能急剧下降。其他方法涉及在转换前进行声源分离,但这通常会引入明显的伪影,导致转换质量显著下降并增加用户的操作成本。为解决这些问题,我们引入了一种新颖的 SVC 方法,该方法使用基于自监督表征的旋律特征来提高在存在 BGM 情况下旋律建模的准确性。在实验中,我们比较了不同自监督学习 (SSL) 模型在旋律提取中的有效性,并首次探索了 SSL 如何有益于旋律提取任务。实验结果表明,我们提出的 SVC 模型在旋律准确性方面显著优于现有基线方法,并且在有噪和干净音频环境下的主观和客观评估中均显示出更高的相似度和自然度。

关键词

引用

@article{arxiv.2502.04722,
  title  = {Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features},
  author = {Wei Chen and Binzhu Sha and Jing Yang and Zhuo Wang and Fan Fan and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2502.04722},
  year   = {2025}
}

备注

Accepted by ICASSP2025