中文

面向古典声乐表演的基于色度与语音特征的实时歌词对齐系统

声音 2024-01-18 v1 机器学习 音频与语音处理

摘要

实时歌词对齐的目标是接收现场歌唱音频作为输入,并实时定位其在给定歌词中的确切位置。该任务可惠及现实应用,例如现场音乐会或歌剧的自动字幕生成。然而,由于只能使用过去输入并在极小延迟内运行的约束,设计实时模型构成了巨大挑战。此外,由于缺乏用于歌词对齐实时模型的数据集,先前研究大多使用私有的内部数据集进行评估,导致缺乏标准评估方法。本文提出了一个面向古典声乐表演的实时歌词对齐系统,具有两个贡献。首先,我们通过寻找色度图(chromagram)和语音后验图(phonetic posteriorgram, PPG)的最佳组合来改进歌词对齐算法,这两种特征分别捕捉歌唱声音的旋律和语音特征。其次,我们将包含同一作品多个表演版本的舒伯特冬之旅数据集(SWD)重新构建为实时歌词对齐的评估集。

关键词

引用

@article{arxiv.2401.09200,
  title  = {A Real-Time Lyrics Alignment System Using Chroma And Phonetic Features For Classical Vocal Performance},
  author = {Jiyun Park and Sangeon Yong and Taegyun Kwon and Juhan Nam},
  journal= {arXiv preprint arXiv:2401.09200},
  year   = {2024}
}

备注

To Appear IEEE ICASSP 2024