用于序列到序列语音转换的梅尔谱图增强
机器学习
2020-06-16 v2 声音
机器学习
摘要
为训练序列到序列语音转换模型,我们需要处理由同一语句构成的语音对数量不足的数据问题。本研究通过实验考察了梅尔谱图增强对从零训练序列到序列语音转换(VC)模型的影响。对于梅尔谱图增强,我们采用了 SpecAugment 中提出的策略。此外,我们提出了新的策略(即频率扭曲、响度与时长控制)以增加数据多样性。而且,为在不训练 VC 模型的情况下找到增强策略的合适超参数,我们提出了超参数搜索策略及用于降低实验成本的新度量,即单位恶化比形变。我们基于不同规模的训练集与增强策略比较了这些梅尔谱图增强方法的效果。实验结果显示,基于时间轴扭曲的策略(即时长控制与时间扭曲)表现优于其他策略。这些结果表明,使用梅尔谱图增强对训练 VC 模型更为有益。
引用
@article{arxiv.2001.01401,
title = {Mel-spectrogram augmentation for sequence to sequence voice conversion},
author = {Yeongtae Hwang and Hyemin Cho and Hongsun Yang and Dong-Ok Won and Insoo Oh and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2001.01401},
year = {2020}
}
备注
5pages, 1 figures, 8 tables