中文

SpecTNT:面向音乐音频的时频 Transformer

声音 2021-10-26 v1 机器学习 音频与语音处理

摘要

Transformer 因其在自然语言处理和计算机视觉中展现出的卓越性能,在音乐信息检索(MIR)领域引起了广泛关注。然而,音频处理领域的前序工作大多将 Transformer 用作类似于 RNN 的时间特征聚合器。在本文中,我们提出了 SpecTNT,一种基于 Transformer 的架构,用于对输入时频表示的频谱序列和时间序列进行建模。具体而言,我们引入了 Transformer-in-Transformer (TNT) 架构的一种新颖变体。在每个 SpecTNT 块中,频谱 Transformer 为每一帧提取与频率相关的特征到频率类令牌 (FCT) 中。随后,FCT 被线性投影并加到时间嵌入 (TE) 中,TE 从 FCT 聚合有用信息。然后,时间 Transformer 处理 TE 以沿时间轴交换信息。通过堆叠 SpecTNT 块,我们构建了 SpecTNT 模型来学习音乐信号的表示。在实验中,SpecTNT 在音乐打标签和人声旋律提取任务中展现了 SOTA 性能,并在和弦识别任务中表现出竞争力。通过消融研究,我们进一步检验了 SpecTNT 及其他设计选择的有效性。

关键词

引用

@article{arxiv.2110.09127,
  title  = {SpecTNT: a Time-Frequency Transformer for Music Audio},
  author = {Wei-Tsung Lu and Ju-Chiang Wang and Minz Won and Keunwoo Choi and Xuchen Song},
  journal= {arXiv preprint arXiv:2110.09127},
  year   = {2021}
}

备注

6 pages