中文

SemAlignVC:利用语义对齐增强零样本声纹转换

音频与语音处理 2025-07-15 v1 声音

摘要

零样本语音转换(VC)在保持语言和副语言内容的前提下合成目标说话人声线的语音。然而,声纹泄漏——即源说话人特征持续存在——仍是一个挑战,尤其是在神经编解码器和LLM-based VC中,量化表示将说话人身份与内容 entangled。我们引入SemAlignVC,一种设计用于防止声纹泄漏的体系结构,该体系结构利用SemAlign(一种新方法)来对齐文本和音频表示,以确保speaker-independent语义编码。该无缝表示在没有显式speaker嵌入的情况下对自回归变压器进行高保真转换。实验表明,SemAlignVC显著减少了声纹泄漏,在说话人声纹相似性、可理解性和自然性方面均优于基线模型,使其成为一个稳健的、隐私保护的和通用的VC解决方案。音频样本可在https://shivammehta25.github.io/SemAlignVC/访问。

关键词

引用

@article{arxiv.2507.09070,
  title  = {SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment},
  author = {Shivam Mehta and Yingru Liu and Zhenyu Tang and Kainan Peng and Vimal Manohar and Shun Zhang and Mike Seltzer and Qing He and Mingbo Ma},
  journal= {arXiv preprint arXiv:2507.09070},
  year   = {2025}
}

备注

6 pages, 2 figures, Accepted at the ISCA Speech Synthesis Workshop (SSW) 2025