重新思考基于遮蔽预测的音频自监督学习中的遮蔽策略
音频与语音处理
2026-03-26 v1 多媒体
声音
摘要
自 Masked Autoencoders 的提出后,人们探索了 various 对遮蔽技术的改进。在本文中,我们针对使用基于遮蔽预测的自监督学习(SSL)在通用音频频谱图上的音频表征学习重新思考遮蔽策略。尽管近期的感知式遮蔽技术引起了关注,但我们注意到它们会带来巨大的计算开销。鼓励这一观察后,我们提出了一种轻量级的 dispersion-weighted masking(DWM)策略,利用音频内容频率结构中固有的谱稀疏性。我们的实验表明,逆块遮蔽(inverse block masking)是近期 SSL 框架中常用的做法,能够提高音频事件理解性能,但会在泛化性方面产生权衡。所提出的 DWM 缓解了这些限制和计算复杂度,带来了持续的性能提升。本工作为基于遮蔽预测的音频表征学习中的遮蔽策略设计提供了实用指导。
引用
@article{arxiv.2603.23810,
title = {Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning},
author = {Daisuke Niizumi and Daiki Takeuchi and Masahiro Yasuda and Binh Thien Nguyen and Noboru Harada and Nobutaka Ono},
journal= {arXiv preprint arXiv:2603.23810},
year = {2026}
}
备注
6+1 pages, 2 figures, 3 tables, accepted at IJCNN 2026