中文

压缩视觉表示

机器学习 2021-12-07 v3 计算机视觉与模式识别 信息论 math.IT

摘要

学习无需人工监督即可良好泛化的有效视觉表示,是将机器学习应用于各种任务的基础性问题。最近,以 SimCLR 和 BYOL 为代表的两类自监督方法——对比学习和潜在自举,取得了显著进展。在这项工作中,我们假设向这些算法中添加显式的信息压缩可以产生更好、更鲁棒的表示。我们通过开发与条件熵瓶颈 (CEB) 目标兼容的 SimCLR 和 BYOL 公式来验证这一点,这使我们能够测量和控制所学表示中的压缩量,并观察它们对下游任务的影响。此外,我们探索了 Lipschitz 连续性与压缩之间的关系,展示了我们学习的编码器 Lipschitz 常数的一个可处理的下界。由于 Lipschitz 连续性与鲁棒性密切相关,这为压缩模型为何更鲁棒提供了新的解释。我们的实验证实,向 SimCLR 和 BYOL 添加压缩显著提高了线性评估准确率和模型在广泛领域偏移下的鲁棒性。特别是,压缩版本的 BYOL 在 ImageNet 上使用 ResNet-50 达到了 76.0% 的 Top-1 线性评估准确率,使用 ResNet-50 2x 达到了 78.8%。

关键词

引用

@article{arxiv.2109.12909,
  title  = {Compressive Visual Representations},
  author = {Kuang-Huei Lee and Anurag Arnab and Sergio Guadarrama and John Canny and Ian Fischer},
  journal= {arXiv preprint arXiv:2109.12909},
  year   = {2021}
}

备注

NeurIPS 2021. 27 pages, 4 figures. Code and pretrained models at https://github.com/google-research/compressive-visual-representations