中文

基于参考演奏的在线音频—歌词对齐

音频与语音处理 2021-08-02 v1

摘要

随着若干带有词级歌词标注的音频录音开源数据集的出现,音频—歌词对齐已成为音乐信息检索(MIR)中日益活跃的研究任务。然而,仍存在若干开放问题,例如面对音频与歌词表示间严重时长不匹配时缺乏鲁棒性;由跨语言声学差异引起的某种程度语言特异性;以及该领域多数成功方法不适用于实时工作。实时歌词对齐(跟踪)将有许多有用应用,如现场音乐会和歌剧中的全自动化字幕显示。本工作中,我们描述了首个具备实时能力的音频—歌词对齐流程,其能够鲁棒地跟踪不同语言的歌词,无需额外语言信息。所提模型对每个音频帧使用极小时序上下文预测(欧洲)音素类上的概率向量,并将该向量与事先由同一作品另一录音计算得到的音素后验概率矩阵对齐,后者作为参考并代理写出歌词。我们在具有挑战性的古典歌剧类型上评估了系统的跟踪精度。最后,通过对京剧(Jingju)的实验展示了对训练外语言的鲁棒性。

关键词

引用

@article{arxiv.2107.14496,
  title  = {On-Line Audio-to-Lyrics Alignment Based on a Reference Performance},
  author = {Charles Brazier and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2107.14496},
  year   = {2021}
}

备注

8 pages, 1 figure, In Proceedings of the 22nd International Society for Music Information Retrieval (ISMIR) Conference, Online, 2021