Beat Transformer:基于膨胀自注意力的分轨节拍与强拍追踪
声音
2022-09-16 v1 音频与语音处理
摘要
我们提出 Beat Transformer,一种用于联合节拍与强拍追踪的新型 Transformer 编码器架构。与以往仅基于音频混合信号谱图追踪节拍的模型不同,我们的模型处理具有多乐器通道的分轨谱图。这源于人类从更丰富的音乐语境(如和弦进行与配器)中感知节拍结构的事实。为此,我们开发了兼具时间维注意力与乐器维注意力的 Transformer 模型,以捕捉深埋的节拍线索。此外,我们的模型采用一种新颖的膨胀自注意力机制,仅以线性复杂度实现强大的层次化建模。实验表明,分轨节拍追踪相较非分轨版本有显著改进。同时,Beat Transformer 在强拍追踪准确率上比 TCN 架构提升多达 4 个百分点。我们进一步发现了一种可解释的注意力模式,其映射了我们对层次化节拍结构的理解。
引用
@article{arxiv.2209.07140,
title = {Beat Transformer: Demixed Beat and Downbeat Tracking with Dilated Self-Attention},
author = {Jingwei Zhao and Gus Xia and Ye Wang},
journal= {arXiv preprint arXiv:2209.07140},
year = {2022}
}
备注
Accepted by ISMIR 2022