O_O-VC:基于合成数据的任意到任意语音转换的一对一对齐方法
声音
2025-10-13 v1 音频与语音处理
摘要
传统语音转换(VC)方法通常试图将说话人身份和语言信息分离为不同的表示,再将其组合以重建音频。然而,有效地解耦这些因素仍然具有挑战性,往往导致训练过程中的信息丢失。本文提出一种新方法,利用高质量预训练多说话人文本转语音(TTS)模型生成的合成语音数据。具体而言,使用共享相同语言内容但说话人身份不同的合成数据对作为输入-输出对来训练语音转换模型。这使得模型能够学习源说话人与目标说话人之间的直接映射,有效捕捉说话人特异性特征,同时保留语言内容。此外,我们提出一种灵活的任意到任意语音转换训练策略,能够泛化到未见说话人和新语言,增强零样本场景下的适应性与性能。实验结果表明,所提方法在词错误率上相对降低16.35%,在说话人余弦相似度上提升5.91%,优于多种现有最先进方法。语音转换样本可在以下网址获取:https://oovc-emnlp-2025.github.io/
引用
@article{arxiv.2510.09061,
title = {O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion},
author = {Huu Tuong Tu and Huan Vu and cuong tien nguyen and Dien Hy Ngo and Nguyen Thi Thu Trang},
journal= {arXiv preprint arXiv:2510.09061},
year = {2025}
}
备注
EMNLP 2025