基于 $\beta$-VAE 的一次性跨语言语音转换解耦语音表示学习
音频与语音处理
2022-10-26 v1 声音
摘要
我们提出一种无监督学习方法,将语音解耦为内容表示与说话人身份表示。我们将该方法应用于极具挑战性的一次性跨语言语音转换任务,以证明解耦的有效性。受 -VAE 启发,我们引入一种在内容与说话人表示所捕获信息间取得平衡的学习目标。此外,架构设计与训练数据集带来的归纳偏置进一步促进了所需的解耦。客观与主观评测均显示了所提方法在语音解耦及一次性跨语言语音转换中的有效性。
引用
@article{arxiv.2210.13771,
title = {Disentangled Speech Representation Learning for One-Shot Cross-lingual Voice Conversion Using $\beta$-VAE},
author = {Hui Lu and Disong Wang and Xixin Wu and Zhiyong Wu and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2210.13771},
year = {2022}
}
备注
Accepted at SLT 2022