中文

掩码 Token 的涌现特性用于高效预训练

计算机视觉与模式识别 2024-04-15 v1

摘要

在掩码语言建模(MLM)成功的推动下,掩码图像建模(MIM)在推动近期突破中的核心地位极大地激发了计算机视觉自监督学习领域的活力。尽管 MIM 在各种下游任务中取得了成就,但其整体效率有时会因预训练阶段的漫长耗时而受到阻碍。本文提出了一种观点,即将掩码 token 的优化作为解决这一普遍问题的手段。首先,我们深入探讨了掩码 token 应具备的内在属性。在这些属性中,我们主要致力于阐述并强调掩码 token 固有的“数据奇异性”特征。通过对预训练模型中掩码 token 与可见 token 之间的异质性进行全面分析,我们提出了一种称为掩码 token 优化(MTO)的新方法,该方法专门设计用于通过权重重新校准和增强掩码 token 的关键特性来提高模型效率。所提出的方法作为一种适应性解决方案,可无缝集成到任何利用掩码 token 的 MIM 方法中。因此,MTO 在预训练效率上取得了显著提升,使得达到近期方法的收敛性能所需的预训练轮数减少了约 50%。

关键词

引用

@article{arxiv.2404.08330,
  title  = {Emerging Property of Masked Token for Effective Pre-training},
  author = {Hyesong Choi and Hunsang Lee and Seyoung Joung and Hyejin Park and Jiyeong Kim and Dongbo Min},
  journal= {arXiv preprint arXiv:2404.08330},
  year   = {2024}
}