歌唱声音音乐动态的自动估计
声音
2024-10-29 v1 信息检索
音频与语音处理
摘要
音乐动态构成了表现力丰富的歌唱声音表演的核心部分。然而,由于缺乏合适的数据集和明确的评估框架,歌唱声音音乐动态的自动分析受到的关注有限。为了应对这一挑战,我们提出了一种数据集构建方法。采用所提出的方法,我们利用最先进的源分离和对齐技术,编制了一个包含509个带有音乐动态标注的歌唱声音表演的数据集,并与163个乐谱文件对齐。乐谱取自浪漫主义时期作品的OpenScore Lieder语料库,该语料库以其丰富的表现力标注而广为人知。利用构建的数据集,我们训练了一个基于多头注意力的CNN模型,采用不同的窗口大小来评估音乐动态估计的有效性。我们为模型训练探索了两种不同的、基于感知动机的输入表示:对数梅尔频谱和基于巴克尺度的特征。为了进行测试,我们与一位专业声乐家合作,手动构建了另一个包含25个带有音乐动态标注的表演的数据集。我们通过实验得出结论,在歌唱声音动态预测任务中,基于巴克尺度的特征优于对数梅尔特征。数据集和代码已公开共享,以促进该主题的进一步研究。
引用
@article{arxiv.2410.20540,
title = {Automatic Estimation of Singing Voice Musical Dynamics},
author = {Jyoti Narang and Nazif Can Tamer and Viviana De La Vega and Xavier Serra},
journal= {arXiv preprint arXiv:2410.20540},
year = {2024}
}
备注
To be published in ISMIR 2024, 6 pages