DisC-VC:解耦且 F0 可控的神经语音转换
音频与语音处理
2022-10-21 v1 声音
机器学习
摘要
语音转换是一项转换给定语句非语言特征的任务。由于语音自然度强烈依赖于其音高模式,在某些应用中,在改变说话人身份的同时保持原始的升降调音高模式是所期望的。现有部分方法通过使用源-滤波器模型或开发以 F0 模式作为模型输入的神经网络来解决此问题。尽管后一种方法相较前者可取得相对更高的音质,其训练过程中并未考虑目标与生成 F0 模式之间的偏差。本文提出一种基于变分自编码器的新型语音转换模型,并辅以一个辅助网络,以确保转换结果正确反映指定的 F0/音色信息。我们通过客观与主观评测展示了所提方法的有效性。
引用
@article{arxiv.2210.11059,
title = {DisC-VC: Disentangled and F0-Controllable Neural Voice Conversion},
author = {Chihiro Watanabe and Hirokazu Kameoka},
journal= {arXiv preprint arXiv:2210.11059},
year = {2022}
}