从商业歌曲音频中转录歌词:歌唱内容处理的第一步
声音
2018-04-17 v1 计算与语言
音频与语音处理
摘要
口语内容处理(如检索与浏览)正日趋成熟,但歌唱内容仍几乎完全被忽视。歌曲如同语音一样是由人声承载大量语义信息的信号,并可被视为一种韵律高度灵活的特殊语音。歌曲音频中的各种问题,例如音高轮廓高度灵活导致的音素时长显著变化,使得从歌曲音频中识别歌词困难得多。本文报告了朝向该目标的一次初步尝试。我们直接从商业歌唱内容中收集了去音乐版的英文歌曲。最佳结果由带数据增强(3 倍速度扰动加若干特殊方法)的 TDNN-LSTM 取得。所得词错率(WER,73.90%)显著低于基线(96.21%),但仍相对较高。
引用
@article{arxiv.1804.05306,
title = {Transcribing Lyrics From Commercial Song Audio: The First Step Towards Singing Content Processing},
author = {Che-Ping Tsai and Yi-Lin Tuan and Lin-shan Lee},
journal= {arXiv preprint arXiv:1804.05306},
year = {2018}
}
备注
Accepted as a conference paper at ICASSP 2018