QR-VC:利用量化残差实现零样本语音转换中的线性解缠
声音
2025-09-11 v2 人工智能
音频与语音处理
摘要
零样本语音转换是一种仅需单一参考语音即可将输入语音的说话人身份转换为目标说话人身份的技术,无需额外的训练。近期方法广泛利用自监督学习特征和 K 均值量化来提取高质量的内容表示,同时消除说话人身份。然而,这种量化过程也消除了细粒度的音素和韵律变化,导致识别度和韵律保存性能下降。虽然先前工作主要关注量化表示,但量化残差尚未得到充分利用,值得进一步探索。本文提出了一种新方法,充分利用量化残差中的时序特性,实现说话人身份与音素及韵律细节的解缠。仅通过 K 均值量化和线性投影,即可实现简单而有效的解缠,无需复杂的网络结构或显式监督。这使得能够仅使用重建损失训练出高保真度的语音转换模型。实验表明,所提方法在主观和客观指标上均优于现有方法,实现了卓越的识别度和说话人相似性,同时改善了韵律保存效果,凸显了线性解缠模块的影响。
引用
@article{arxiv.2411.16147,
title = {QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion},
author = {Youngjun Sim and Jinsung Yoon and Wooyeol Jeong and Young-Joo Suh},
journal= {arXiv preprint arXiv:2411.16147},
year = {2025}
}
备注
5 pages. Accepted to EUSIPCO 2025 (Paper #1938)