中文

面向灵活归纳偏置的渐进式重参数化调度

计算机视觉与模式识别 2022-10-05 v1

摘要

近期计算机视觉中有两种事实上的标准架构:卷积神经网络(CNN)与视觉Transformer(ViT)。卷积的强归纳偏置有助于模型高效学习样本,但此类强偏置也在数据充足时限制了CNN的上限。相反,ViT在小数据上逊于CNN,而在数据充足时更优。近期方法试图结合这两种架构之长。然而,我们通过比较不同比例采样的ImageNet子集上各类模型的精度,表明这些方法忽视了最优归纳偏置也会随目标数据规模变化而改变。此外,通过对特征图的傅里叶分析,模型对信号频率的响应模式随之变化,我们观察到何种归纳偏置对各数据规模有利。模型中包含的类卷积归纳偏置越多,ViT类模型超越ResNet性能所需的数据规模越小。为获得在数据规模上具有灵活归纳偏置的模型,我们证明重参数化可在卷积与自注意力之间插值归纳偏置。通过调整模型停留在卷积阶段的轮数,我们展示从卷积到自注意力的重参数化在CNN与ViT之间插值了傅里叶分析模式。基于这些发现,我们提出渐进式重参数化调度(PRS),其中重参数化逐层调节所需的类卷积或类自注意力归纳偏置量。对于小规模数据集,我们的PRS在后期层以线性更快的速度执行从卷积到自注意力的重参数化。PRS在小规模数据集(如CIFAR-100)上优于既往研究。

关键词

引用

@article{arxiv.2210.01370,
  title  = {Towards Flexible Inductive Bias via Progressive Reparameterization Scheduling},
  author = {Yunsung Lee and Gyuseong Lee and Kwangrok Ryoo and Hyojun Go and Jihye Park and Seungryong Kim},
  journal= {arXiv preprint arXiv:2210.01370},
  year   = {2022}
}

备注

Accepted at VIPriors ECCVW 2022, camera-ready version