中文

DAFMSVC:基于双注意力机制和流匹配的一键式演唱声转换

声音 2025-08-11 v1 人工智能 机器学习

摘要

演唱声转换(SVC)将源歌手的声色转换为目标声色,同时保持旋律和歌词。任何到任何 SVC 的关键挑战在于在不影响音质的情况下适配不可见的说话人声彩。现有方法要么面临声彩泄漏,要么难以在生成音频中实现令人满意的声彩相似性和音质。为解决这些挑战,我们提出了 DAFMSVC,方法将源音频的自监督学习(SSL)特征替换为来自目标音频的最相似 SSL 特征,以防止声彩泄漏。它还采用双交叉注意力机制,用于说话人嵌入、旋律和语言内容的自适应融合。此外,我们引入了流匹配模块,用于从融合特征生成高质量音频。实验结果表明,DAFMSVC 在声彩相似性和自然性方面显著提升, 在主观和客观评估中均优于最先进的方法。

关键词

引用

@article{arxiv.2508.05978,
  title  = {DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching},
  author = {Wei Chen and Binzhu Sha and Dan Luo and Jing Yang and Zhuo Wang and Fan Fan and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2508.05978},
  year   = {2025}
}

备注

Accepted by INTERSPEECH 2025