中文

具有多窗口局部-全局注意力的掩码自编码器是更优的音频学习器

声音 2023-10-03 v2 人工智能 音频与语音处理

摘要

在这项工作中,我们提出了一种多窗口掩码自编码器(MW-MAE),其配备了一种新颖的多窗口多头注意力(MW-MHA)模块,该模块通过若干个不同局部和全局窗口的注意力头,在每个解码器transformer块中促进局部-全局交互的建模。在十个下游音频任务上的实证结果表明,MW-MAE在整体性能上持续优于标准MAE,并学习到更好的通用音频表征,同时展现出明显更好的缩放特性。对注意力距离和熵的研究表明,MW-MAE编码器学习到了具有更广局部和全局注意力的头。通过投影加权典型相关分析(PWCCA)分析注意力头特征表征表明,MW-MAE解码器各层中相同窗口大小的注意力头学习到了相关的特征表征,这使得每个块都能独立捕获局部和全局信息,从而导致解耦的解码器特征层次。用于特征提取和下游实验的代码以及预训练模型将公开发布。

关键词

引用

@article{arxiv.2306.00561,
  title  = {Masked Autoencoders with Multi-Window Local-Global Attention Are Better Audio Learners},
  author = {Sarthak Yadav and Sergios Theodoridis and Lars Kai Hansen and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2306.00561},
  year   = {2023}
}