中文

AGAIN-VC:一种利用激活引导与自适应实例归一化的单样本语音转换

音频与语音处理 2020-11-03 v1 声音

摘要

近来,语音转换 (VC) 得到了广泛研究。许多 VC 系统使用基于解耦的学习技术,从语音信号中分离说话人与语言内容信息。随后,它们通过将说话人信息替换为目标说话人的信息来实现语音转换。为防止说话人信息泄漏到内容嵌入中,以往工作要么降低维度,要么将内容嵌入量化作为强信息瓶颈。这些机制在某种程度上损害了合成质量。本工作中,我们提出 AGAIN-VC,一种利用激活引导与自适应实例归一化 (Adaptive Instance Normalization) 的创新 VC 系统。AGAIN-VC 是一个基于自编码器的模型,由单一编码器与解码器组成。通过在内容嵌入上采用恰当的激活作为信息瓶颈,转换后语音的合成质量与说话人相似度之间的权衡得到大幅改善。该单样本 VC 系统在主观与客观评价中均取得最佳表现。

关键词

引用

@article{arxiv.2011.00316,
  title  = {AGAIN-VC: A One-shot Voice Conversion using Activation Guidance and Adaptive Instance Normalization},
  author = {Yen-Hao Chen and Da-Yi Wu and Tsung-Han Wu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2011.00316},
  year   = {2020}
}

备注

Submitted to ICASSP 2021