中文

ACVAE-VC:基于辅助分类器变分自编码器的非并行多对多语音转换

机器学习 2020-10-13 v3 机器学习 声音 音频与语音处理

摘要

本文提出一种使用条件变分自编码器(VAE)的变体——辅助分类器 VAE(ACVAE)的非并行多对多语音转换(VC)方法。所提方法具有三个关键特征。首先,它采用全卷积架构构建编码器与解码器网络,使网络能够学习捕获源语音与目标语音声学特征序列中时间依赖关系的转换规则。其次,它使用信息论正则化进行模型训练,以确保属性类别标签的信息在转换过程中不丢失。对于常规 CVAE,编码器和解码器可自由忽略属性类别标签输入。这可能带来问题,因为在此情况下,属性类别标签在测试时对控制输入语音的嗓音特征影响甚微。通过引入辅助分类器并训练编码器与解码器使解码器输出的属性类别能被该分类器正确预测,可避免此类情况。第三,它通过将输入语音的频谱细节直接移植到其转换版本中,避免在测试时产生蜂鸣声语音。主观评价实验表明,这一简单方法在非并行多对多说话人身份转换任务中表现相当良好。

关键词

引用

@article{arxiv.1808.05092,
  title  = {ACVAE-VC: Non-parallel many-to-many voice conversion with auxiliary classifier variational autoencoder},
  author = {Hirokazu Kameoka and Takuhiro Kaneko and Kou Tanaka and Nobukatsu Hojo},
  journal= {arXiv preprint arXiv:1808.05092},
  year   = {2020}
}

备注

Publised in IEEE/ACM Trans. ASLP https://ieeexplore.ieee.org/abstract/document/8718381 Please also refer to our related articles: arXiv:1806.02169, arXiv:2008.12604