利用导航信息学习视觉表征
计算机视觉与模式识别
2022-02-17 v1 人工智能
机器学习
摘要
儿童通过无监督探索来构建世界的视觉表征,我们假设这种学习能力的一个关键部分是利用自生成的导航信息作为相似性标签,以驱动自监督学习的训练目标。本工作的目标是在视觉环境中利用导航信息,使训练性能超越当前最先进的自监督训练。在此,我们表明在对比学习的预训练阶段使用空间与时间信息,可相对于使用实例判别来区分同一图像的两个变换或两张不同图像的传统对比学习方法,提升下游分类的性能。我们设计了一条流水线,从照片级真实光线追踪环境 (ThreeDWorld) 生成以自我为中心的视觉图像,并为每张图像记录相关的导航信息。通过修改 Momentum Contrast (MoCo) 模型,我们在预训练阶段引入空间与时间信息来评估两个视图的相似性,以取代实例判别。本工作揭示了上下文信息在改进表征学习方面的有效性与高效性。该工作有助于我们理解儿童如何在无外部监督的情况下学会观看世界。
引用
@article{arxiv.2202.08114,
title = {Using Navigational Information to Learn Visual Representations},
author = {Lizhen Zhu and Brad Wyble and James Z. Wang},
journal= {arXiv preprint arXiv:2202.08114},
year = {2022}
}
备注
Abstract submission to Computational and Systems Neuroscience (Cosyne) 2022, accepted