中文

基于音频到字符识别模型的复调音乐端到端歌词对齐

声音 2019-02-20 v1 机器学习 音频与语音处理

摘要

时间对齐的歌词可通过支持卡拉OK、基于文本的歌曲检索与曲内导航等应用来丰富音乐聆听体验。与语音合成对齐相比,尽管已有诸多尝试将包括人声分离与检测在内的众多子模块组合以分解该问题,歌词对齐仍极具挑战。此外,训练需要以某种形式提供细粒度标注。在此,我们提出一种基于改进Wave-U-Net架构的新颖系统,它利用学到的各信号分量多尺度表示,从原始音频直接预测字符概率。该系统没有需要优化相互依赖关系的子模块。我们的训练流程设计用于利用现实世界中可用的弱行级标注。在标准数据集上以0.35秒的平均对齐误差,我们的系统比现有最优方法(SOTA)好一个数量级。

关键词

引用

@article{arxiv.1902.06797,
  title  = {End-to-end Lyrics Alignment for Polyphonic Music Using an Audio-to-Character Recognition Model},
  author = {Daniel Stoller and Simon Durand and Sebastian Ewert},
  journal= {arXiv preprint arXiv:1902.06797},
  year   = {2019}
}

备注

5 pages (1 for references), 2 figures, 2 tables. Camera-ready version, accepted at the International Conference on Acoustics, Speech, and Signal Processing 2019 (ICASSP)