中文

CNN 在自监督学习中的反击:可能只需更大的卷积核尺寸

计算机视觉与模式识别 2023-12-13 v2 人工智能

摘要

视觉 Transformer 凭借其出色的缩放趋势在计算机视觉领域迅速崛起,并逐渐取代卷积神经网络 (CNN)。最近关于自监督学习 (SSL) 的工作引入了孪生预训练任务,在此类任务中,Transformer 主干网络持续展现出比 CNN 更强的结果。人们开始相信,在 SSL 背景下,Transformer 或自注意力模块本质上比 CNN 更具适用性。然而,值得注意的是,大多数(甚至所有)使用 CNN 的先前 SSL 技术都选择标准 ResNet 作为其主干网络,而已知其架构有效性已落后于先进的视觉 Transformer。因此,目前尚不清楚自注意力操作是否为近期 SSL 进展的关键所在——或者 CNN 也能通过更先进的设计展现出同样的卓越性?我们能否缩小 Transformer 与 CNN 之间的 SSL 性能差距?为了回答这些引人入胜的问题,我们将自监督预训练应用于近期提出的、更强的大卷积核 CNN 架构,并在 SSL 性能上与 Transformer 进行了公平对比。我们的结果表明,只需在其它微小调整之外增大卷积核尺寸,我们就能够构建出性能与最优 SSL 训练的 Transformer 相当或更优的纯 CNN SSL 架构。令人印象深刻的是,当迁移到下游任务 \texttt{MS COCO} 检测和分割时,我们的 SSL 预训练 CNN 模型(训练 100 个 epoch)取得了与训练 300 个 epoch 的 Transformer 对应模型同样优异的性能。我们希望这项工作能有助于更好地理解对于自监督学习主干网络而言什么是必要的(或非必要的)。

关键词

引用

@article{arxiv.2312.05695,
  title  = {The Counterattack of CNNs in Self-Supervised Learning: Larger Kernel Size might be All You Need},
  author = {Tianjin Huang and Tianlong Chen and Zhangyang Wang and Shiwei Liu},
  journal= {arXiv preprint arXiv:2312.05695},
  year   = {2023}
}