中文

理解掩码重建预训练为何有助于下游任务

机器学习 2023-02-14 v5 计算机视觉与模式识别 神经与进化计算 机器学习

摘要

对于无监督预训练,掩码重建预训练(MRP)方法(例如 MAE 和 data2vec)随机掩码输入块,然后通过自编码器重建这些被掩码块的像素或语义特征。随后对于下游任务,对预训练编码器进行有监督微调显著优于从头训练的常规“有监督学习”(SL)。然而,目前仍不清楚 1) MRP 在预训练阶段如何进行语义特征学习,以及 2) 它为何有助于下游任务。为解决这些问题,我们首先从理论上证明,在一个两层/一层卷积编码器/解码器的自编码器上,MRP 能够捕获预训练数据集中每个潜在语义类的所有判别性特征。进而考虑到预训练数据集规模巨大且多样性高,从而覆盖了下游数据集中的大多数特征,在微调阶段,预训练编码器能够尽可能多地捕获下游数据集中的特征,并且理论上保证不会丢失这些特征。相比之下,由于彩票假说,SL 仅随机捕获部分特征。因此,MRP 在分类任务上可证明地取得优于 SL 的性能。实验结果验证了我们的数据假设及理论含义。

关键词

引用

@article{arxiv.2206.03826,
  title  = {Towards Understanding Why Mask-Reconstruction Pretraining Helps in Downstream Tasks},
  author = {Jiachun Pan and Pan Zhou and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2206.03826},
  year   = {2023}
}