中文

利用孪生网络学习帧相似度用于音频到乐谱对齐

声音 2020-11-17 v1 信息检索 机器学习 音频与语音处理

摘要

音频到乐谱对齐旨在生成演奏音频与给定乐曲乐谱之间的准确映射。标准对齐方法基于动态时间规整(DTW)并使用手工设计特征,无法适应不同声学条件。我们提出一种方法以克服该限制,使用学习的帧相似度进行音频到乐谱对齐。我们关注钢琴音乐的离线音频到乐谱对齐。在不同声学条件的音乐数据上的实验表明,我们的方法比使用手工设计特征的标准基于DTW的方法取得了更高的对齐准确率,并同时生成鲁棒的对齐结果且可适应不同领域。

关键词

引用

@article{arxiv.2011.07546,
  title  = {Learning Frame Similarity using Siamese networks for Audio-to-Score Alignment},
  author = {Ruchit Agrawal and Simon Dixon},
  journal= {arXiv preprint arXiv:2011.07546},
  year   = {2020}
}

备注

Accepted at EUSIPCO 2020