用于速度不变音频-乐谱检索的软注意力模型学习
信息检索
2019-06-27 v1 计算机视觉与模式识别
机器学习
声音
音频与语音处理
摘要
将大型数字化音频录音库与其对应的乐谱图像相连接,长期以来一直是研究人员开发新型跨模态检索系统的动力。近年来,基于深度神经网络嵌入空间学习的检索系统朝实现这一愿景迈进了一步。然而,音乐录音中的全局与局部速度偏差仍需要对系统所给时间上下文的量进行细致调参。在本文中,我们通过在音频输入上引入额外的软注意力机制来解决此问题。在合成钢琴数据上的定量与定性结果表明,该注意力通过基于音频速度聚焦于输入表示的不同部分,提升了检索系统的鲁棒性。受这些结果鼓舞,我们认为注意力模型作为许多 MIR(音乐信息检索)任务的通用工具具有潜力。
引用
@article{arxiv.1906.10996,
title = {Learning Soft-Attention Models for Tempo-invariant Audio-Sheet Music Retrieval},
author = {Stefan Balke and Matthias Dorfer and Luis Carvalho and Andreas Arzt and Gerhard Widmer},
journal= {arXiv preprint arXiv:1906.10996},
year = {2019}
}
备注
Accepted for publication at ISMIR 2019