中文

基于 Transformer 的序列到序列钢琴转录

声音 2021-07-21 v1 机器学习 音频与语音处理

摘要

近年来,通过在大型数据集上训练定制的深度神经网络,自动音乐转录取得了显著进展。然而,这些模型需要对网络架构、输入/输出表示以及复杂的解码方案进行大量的领域特定设计。在这项工作中,我们展示了使用带有标准解码方法的通用编码器-解码器 Transformer 也能达到同等的性能。我们证明该模型可以学会将频谱图输入直接转换为类 MIDI 的输出事件,以完成多个转录任务。这种序列到序列方法通过联合建模音频特征与类语言的输出依赖关系,简化了转录过程,从而免去了对任务特定架构的需求。这些结果表明,通过专注于数据集创建与标注而非定制模型设计,有可能构建新的音乐信息检索模型。

关键词

引用

@article{arxiv.2107.09142,
  title  = {Sequence-to-Sequence Piano Transcription with Transformers},
  author = {Curtis Hawthorne and Ian Simon and Rigel Swavely and Ethan Manilow and Jesse Engel},
  journal= {arXiv preprint arXiv:2107.09142},
  year   = {2021}
}