TGAVC:以文本引导与对抗训练改进自编码器语音转换
声音
2022-08-09 v1 人工智能
音频与语音处理
摘要
非平行多对多语音转换仍是一项有趣而具挑战的语音处理任务。近来,基于条件自编码器的 AutoVC 方法通过利用信息约束瓶颈解耦说话人身份与语音内容,取得了优异的转换结果。然而,由于纯自编码器训练方式,难以评估内容与说话人身份的分离效果。本文提出一种新颖的语音转换框架,称为 ext uided utoVC(TGAVC),以更有效地从语音中分离内容与音色,其中设计基于文本转写的期望内容嵌入来引导语音内容的提取。此外,应用对抗训练以消除从语音提取的估计内容嵌入中的说话人身份信息。在期望内容嵌入与对抗训练的引导下,内容编码器被训练为从语音中提取与说话人无关的内容嵌入。在 AISHELL-3 数据集上的实验表明,所提模型在自然度与转换语音相似度方面优于 AutoVC。
引用
@article{arxiv.2208.04035,
title = {TGAVC: Improving Autoencoder Voice Conversion with Text-Guided and Adversarial Training},
author = {Huaizhen Tang and Xulong Zhang and Jianzong Wang and Ning Cheng and Zhen Zeng and Edward Xiao and Jing Xiao},
journal= {arXiv preprint arXiv:2208.04035},
year = {2022}
}
备注
ASRU 6 pages