PDAugment:通过音高与时长调整进行数据增强的自动歌词转写方法
音频与语音处理
2021-09-20 v2 声音
摘要
自动歌词转写(ALT)可视为针对歌唱声的自动语音识别(ASR),是学术界与工业界一个有趣且实用的课题。ALT发展不佳主要由于缺少成对的歌唱声与歌词数据集用于模型训练。考虑到存在大量ASR训练数据,一种直接方法是利用ASR数据增强ALT训练。然而,由于歌唱声与标准语音数据之间存在差距(其根源在于歌唱声中音乐特有的声学特征),直接用ASR数据训练ALT系统收效甚微。本文提出PDAugment,一种在音节级别根据乐谱指导调整语音音高和时长以辅助ALT训练的数据增强方法。具体而言,我们将自然语音中每个音节的音高和时长调整为从乐谱提取的对应音符的那些值,从而缩小自然语音与歌唱声之间的差距。在DSing30和Dali语料上的实验表明,配备我们PDAugment的ALT系统分别比先前最先进系统(SOTA)的WER降低5.9%和18.1%,证明了PDAugment对ALT的有效性。
引用
@article{arxiv.2109.07940,
title = {PDAugment: Data Augmentation by Pitch and Duration Adjustments for Automatic Lyrics Transcription},
author = {Chen Zhang and Jiaxing Yu and LuChin Chang and Xu Tan and Jiawei Chen and Tao Qin and Kejun Zhang},
journal= {arXiv preprint arXiv:2109.07940},
year = {2021}
}
备注
7 pages