基于感知熵损失的序列到序列歌声合成
音频与语音处理
2021-03-01 v2 机器学习
声音
摘要
基于神经网络(NN)的歌声合成(SVS)系统需要充足数据才能训练良好,并因数据稀缺而易过拟合。然而,由于数据获取与标注成本高,我们在构建 SVS 系统时经常遭遇数据受限问题。本工作中,我们提出一种源自心理声学听觉模型的感知熵(PE)损失以正则化网络。利用一小时的开放源代码歌声数据库,我们探究了 PE 损失对各种主流序列到序列模型的影响,包括基于 RNN、基于 transformer 及基于 conformer 的模型。实验表明,PE 损失能缓解过拟合问题,并显著提升客观与主观评价所反映的合成歌声质量。
引用
@article{arxiv.2010.12024,
title = {Sequence-to-sequence Singing Voice Synthesis with Perceptual Entropy Loss},
author = {Jiatong Shi and Shuai Guo and Nan Huo and Yuekai Zhang and Qin Jin},
journal= {arXiv preprint arXiv:2010.12024},
year = {2021}
}
备注
Accepted by ICASSP2021