中文

用时间-频率 Transformer 建模节拍与强拍

声音 2022-05-31 v1 音频与语音处理

摘要

Transformer 是一种成功的深度神经网络 (DNN) 架构,已展现出其在自然语言处理以及音乐信息检索 (MIR) 中的通用性。本文提出一种基于 Transformer 的新方法来解决节拍与强拍跟踪问题。该方法采用 SpecTNT(Transformer 中的谱-时 Transformer),这是 Transformer 的一种变体,可对音乐音频的时间-频率输入的谱维与时维进行建模。SpecTNT 模型使用堆叠的块,每个块由两级 Transformer 编码器组成。较低级(或谱)编码器处理谱特征,使模型能够关注每帧的谐波分量。由于强拍指示小节边界且常伴随谐波变化,此步骤可能有助于强拍建模。较高级(或时)编码器聚合有用的局部谱信息以关注节拍/强拍位置。我们还提出了一种将 SpecTNT 与最先进模型时间卷积网络 (TCN) 相结合的架构,以进一步提升性能。大量实验表明,我们的方法在强拍跟踪上显著优于 TCN,同时在节拍跟踪上保持相当的结果。

关键词

引用

@article{arxiv.2205.14701,
  title  = {Modeling Beats and Downbeats with a Time-Frequency Transformer},
  author = {Yun-Ning Hung and Ju-Chiang Wang and Xuchen Song and Wei-Tsung Lu and Minz Won},
  journal= {arXiv preprint arXiv:2205.14701},
  year   = {2022}
}

备注

This paper is accepted for publication at ICASSP 2022