利用孪生网络学习帧相似度用于音频到乐谱对齐
声音
2020-11-17 v1 信息检索
机器学习
音频与语音处理
摘要
音频到乐谱对齐旨在生成演奏音频与给定乐曲乐谱之间的准确映射。标准对齐方法基于动态时间规整(DTW)并使用手工设计特征,无法适应不同声学条件。我们提出一种方法以克服该限制,使用学习的帧相似度进行音频到乐谱对齐。我们关注钢琴音乐的离线音频到乐谱对齐。在不同声学条件的音乐数据上的实验表明,我们的方法比使用手工设计特征的标准基于DTW的方法取得了更高的对齐准确率,并同时生成鲁棒的对齐结果且可适应不同领域。
引用
@article{arxiv.2011.07546,
title = {Learning Frame Similarity using Siamese networks for Audio-to-Score Alignment},
author = {Ruchit Agrawal and Simon Dixon},
journal= {arXiv preprint arXiv:2011.07546},
year = {2020}
}
备注
Accepted at EUSIPCO 2020