面向古典声乐表演的基于色度与语音特征的实时歌词对齐系统
声音
2024-01-18 v1 机器学习
音频与语音处理
摘要
实时歌词对齐的目标是接收现场歌唱音频作为输入,并实时定位其在给定歌词中的确切位置。该任务可惠及现实应用,例如现场音乐会或歌剧的自动字幕生成。然而,由于只能使用过去输入并在极小延迟内运行的约束,设计实时模型构成了巨大挑战。此外,由于缺乏用于歌词对齐实时模型的数据集,先前研究大多使用私有的内部数据集进行评估,导致缺乏标准评估方法。本文提出了一个面向古典声乐表演的实时歌词对齐系统,具有两个贡献。首先,我们通过寻找色度图(chromagram)和语音后验图(phonetic posteriorgram, PPG)的最佳组合来改进歌词对齐算法,这两种特征分别捕捉歌唱声音的旋律和语音特征。其次,我们将包含同一作品多个表演版本的舒伯特冬之旅数据集(SWD)重新构建为实时歌词对齐的评估集。
引用
@article{arxiv.2401.09200,
title = {A Real-Time Lyrics Alignment System Using Chroma And Phonetic Features For Classical Vocal Performance},
author = {Jiyun Park and Sangeon Yong and Taegyun Kwon and Juhan Nam},
journal= {arXiv preprint arXiv:2401.09200},
year = {2024}
}
备注
To Appear IEEE ICASSP 2024