基于混合ASR瓶颈特征解耦内容与细粒度韵律信息的语音转换
声音
2022-03-25 v1 计算与语言
音频与语音处理
摘要
近年来,通过引入自动语音识别(ASR)模型提取的瓶颈特征(BNFs),非平行数据语音转换(VC)取得了显著突破。然而,BNFs的选择对VC结果有显著影响。例如,当从以交叉熵损失训练的ASR(CE-BNFs)中提取BNFs并输入神经网络训练VC系统时,转换语音的音色相似度显著下降。若BNFs从以连接时序分类损失训练的ASR(CTC-BNFs)中提取,转换语音的自然度可能降低。该现象由BNFs所含信息的差异导致。本文提出一种使用从CTC-BNFs和CE-BNFs提取的混合瓶颈特征以互补各自优势的任意到一VC方法。采用梯度反转层和实例归一化从CE-BNFs中提取韵律信息、从CTC-BNFs中提取内容信息。使用自回归解码器和Hifi-GAN声码器生成高质量波形。实验结果表明,所提方法在相似度、自然度、质量上均优于基线方法,并揭示了CE-BNFs与CTC-BNFs所含信息的差异及其对转换语音的影响。
引用
@article{arxiv.2203.12813,
title = {Disentangleing Content and Fine-grained Prosody Information via Hybrid ASR Bottleneck Features for Voice Conversion},
author = {Xintao Zhao and Feng Liu and Changhe Song and Zhiyong Wu and Shiyin Kang and Deyi Tuo and Helen Meng},
journal= {arXiv preprint arXiv:2203.12813},
year = {2022}
}
备注
Accepted by ICASSP 2022