结合语音到歌唱风格迁移的端到端歌词识别
声音
2021-02-18 v1 机器学习
音频与语音处理
摘要
由于缺乏大量转写数据,单声部/多声部音乐的自动转写是一项具有挑战性的任务。本文提出一种基于声码器语音合成器的数据增强方法,将自然语音转换为歌唱声音。该方法称为语音到歌唱(V2S),通过用歌唱声音的 F0 轮廓调制自然语音的 F0 轮廓来实现声音风格转换。基于 V2S 模型的风格迁移能生成质量良好的歌唱声音,从而能够将大规模自然语音语料转换为对构建端到端(E2E)歌词转写系统有用的歌唱声音。在单声部歌唱声音数据的实验中,V2S 风格迁移为 E2E 歌词转写系统带来了显著增益(相对提升 21%)。我们还讨论了迁移学习和基于歌词的语言建模等附加组件,以提升歌词转写系统的性能。
引用
@article{arxiv.2102.08575,
title = {End-to-end lyrics Recognition with Voice to Singing Style Transfer},
author = {Sakya Basak and Shrutina Agarwal and Sriram Ganapathy and Naoya Takahashi},
journal= {arXiv preprint arXiv:2102.08575},
year = {2021}
}
备注
accepted at ICASSP 2021