中文

基于稀疏注意力机制的高效Transformer钢琴转谱

声音 2025-09-12 v1 多媒体

摘要

本文探讨了基于计算效率高且性能优异的Transformer变体的自动钢琴转谱问题,这些变体能够捕获整首音乐作品中较长期望依赖。最近的基于Transformer的序列到序列模型在钢琴转谱中表现优异。然而,这些模型由于自注意力机制的二次复杂度,无法一次性处理整首作品,实际中通常以滑动窗口方式处理音乐信号。为克服这一限制,我们提出一种高效架构,引入稀疏注意力机制。具体而言,我们为编码器和解码器引入滑动窗口自注意力机制,并采用混合全局-局部交叉注意力机制,根据MIDI token类型进行各种跨度的注意。我们还在编码器和解码器之间采用层次化池化策略,以进一步降低计算负荷。在MAESTRO数据集上的实验表明,所提出的模型在计算成本和内存使用方面显著降低,加速了推理速度,同时保持了与全注意力基线相当的转谱性能。这使得在相同硬件条件下能够进行更长音频上下文的训练,证明了稀疏注意力在构建高效且高性能钢琴转谱系统方面的可行性。代码已公开于https://github.com/WX-Wei/efficient-seq2seq-piano-trans.

引用

@article{arxiv.2509.09318,
  title  = {Efficient Transformer-Based Piano Transcription With Sparse Attention Mechanisms},
  author = {Weixing Wei and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2509.09318},
  year   = {2025}
}

备注

Accepted by APSIPA 2025