利用对比预测神经三维映射从无标签视频中学习
计算机视觉与模式识别
2020-05-19 v6
摘要
预测编码理论表明,大脑通过在不同抽象层级上预测观测结果来进行学习。最基础的预测任务之一是视角预测:给定场景从另一视角看会是什么样子?人类在此任务上表现出色。我们想象和填补缺失信息的能力与感知紧密耦合:我们感觉自己看到了三维世界,而实际上仅有来自世界前表面的信息到达视网膜。本文探讨了视角预测在三维视觉识别发展中的作用。我们提出神经三维映射网络,其以移动相机捕获的2.5D(颜色和深度)视频流为输入,通过将场景内容与被摄相机运动解耦,将其提升为场景的稳定三维特征图。该模型还将其三维特征图投影到新颖视角,以预测并与目标视图匹配。我们提出对比预测损失来替代标准的颜色回归损失,并表明这在复杂照片级真实数据上带来更好的性能。我们展示了所提模型学习到的视觉表示可用于(1)三维物体检测器的半监督学习,以及(2)三维运动物体检测器的无监督学习,方法是在动态场景视频中估计推断出的三维特征图的运动。据我们所知,这是首个通过实证表明视角预测是可扩展的自监督任务且有益于三维物体检测的工作。
引用
@article{arxiv.1906.03764,
title = {Learning from Unlabelled Videos Using Contrastive Predictive Neural 3D Mapping},
author = {Adam W. Harley and Shrinidhi K. Lakshmikanth and Fangyu Li and Xian Zhou and Hsiao-Yu Fish Tung and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:1906.03764},
year = {2020}
}