Takin-VC:通过自适应混合内容编码和增强音色建模实现表达性零样体语音转换
声音
2025-01-13 v2 人工智能
音频与语音处理
摘要
表达性零样体语音转换(zero-shot voice conversion, VC)是一个关键且具有挑战性的任务,旨在将源音色转换为任意未见说话人,同时保留原始内容和表达特征。尽管近期在零样体 VC 方面取得了进展,但在说话人相似性和语音自然性方面仍有很大的提升空间。此外,现有的零样体 VC 系统难以完全再现高度表达语音中的旁语言信息,如呼吸、哭泣和情感细微差别,限制了其实际应用。为此,我们提出了 Takin-VC,一种通过自适应混合内容编码和记忆增强情境感知音色建模的新型表达零样体 VC 框架。具体而言,我们引入一种创新的混合内容编码器,包含自适应融合模块,能够以隐式方式有效地整合预训练 WavLM 和 HybridFormer 的量化特征,以提取精确的语言特征并丰富旁语言元素。对于音色建模,我们提出了高级的记忆增强和情境感知模块,用于生成高质量的目标音色特征和融合表示,使源内容与目标音色无缝对齐。为增强实时性能,我们主张采用条件流匹配模型来重构源语音的 Mel 频谱图。实验结果表明,我们的 Takin-VC 在语音自然性、语音表达性和说话人相似性方面 consistently 优于最先进的 VC 系统,同时提供了增强的推理速度。
引用
@article{arxiv.2410.01350,
title = {Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling},
author = {Yuguang Yang and Yu Pan and Jixun Yao and Xiang Zhang and Jianhao Ye and Hongbin Zhou and Lei Xie and Lei Ma and Jianjun Zhao},
journal= {arXiv preprint arXiv:2410.01350},
year = {2025}
}
备注
Work in Progress; Under Review