中文

SVSNet:一种端到端说话人语音相似度评估模型

音频与语音处理 2022-03-28 v2 机器学习 声音

摘要

近年来,为众多语音生成任务衍生的神经评估指标引起了极大关注。本文中,我们提出 SVSNet,首个端到端神经网络模型,用于评估语音转换任务中转换语音与自然语音之间的说话人语音相似度。与多数使用手工特征的神经评估指标不同,SVSNet 直接以原始波形作为输入,以更完整地利用语音信息进行预测。SVSNet 由编码器、协同注意力、距离计算和预测模块组成,并以端到端方式训练。在 Voice Conversion Challenge 2018 和 2020(VCC2018 和 VCC2020)数据集上的实验结果表明,SVSNet 在语句级和系统级的说话人相似度评估上均优于知名基线系统。

关键词

引用

@article{arxiv.2107.09392,
  title  = {SVSNet: An End-to-end Speaker Voice Similarity Assessment Model},
  author = {Cheng-Hung Hu and Yu-Huai Peng and Junichi Yamagishi and Yu Tsao and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2107.09392},
  year   = {2022}
}

备注

To appear in IEEE Signal Processing Letters (SPL)