中文

用加性注意力重新审视 Onsets and Frames 模型

声音 2021-04-15 v1 音频与语音处理

摘要

自动音乐转录(AMT)的近期进展通过结合起音和止音检测实现了高度准确的复调钢琴转录结果。然而,现有文献主要聚焦于利用深度复杂模型以达到最先进(SOTA)准确率,而未理解模型行为。本文中,我们对 Onsets-and-Frames AMT 模型进行了全面考察,并 pinpoint( pinpoint:精确定位)了促成强劲 AMT 性能的关键组件。这是通过利用一种改进的加性注意力机制实现的。实验结果表明,超出适度时间上下文的注意力机制无益于模型,且基于规则的后处理在很大程度上负责了 SOTA 性能。我们还证明,无论模型复杂度如何,起音都是最显著的注意力特征。这些发现鼓励 AMT 研究更多权衡一个鲁棒的起音检测器与有效的后处理器。

关键词

引用

@article{arxiv.2104.06607,
  title  = {Revisiting the Onsets and Frames Model with Additive Attention},
  author = {Kin Wai Cheuk and Yin-Jyun Luo and Emmanouil Benetos and Dorien Herremans},
  journal= {arXiv preprint arXiv:2104.06607},
  year   = {2021}
}

备注

Accepted in IJCNN 2021 Special Session S04. https://dr-costas.github.io/rlasmp2021-website/