CoCoNets:连续对比式三维场景表示
计算机视觉与模式识别
2021-04-09 v1
摘要
本文探索从带位姿的 RGB 与 RGB-D 图像和视频中自监督学习模态无关(不依赖物体与场景语义内容)的模态不可知三维特征表示,并在视觉对应、物体跟踪与物体检测等下游任务中评估所得场景表示。模型以三维特征点的形式推断场景的潜在三维表示,其中每个连续世界三维点被映射到其对应特征向量。模型通过渲染三维特征云至查询视点并与查询视点预测的三维特征点云进行匹配,以对比视点预测方式进行训练。值得注意的是,该表示可对任意三维位置进行查询,即便该位置在输入视点中不可见。我们的模型汇集了近期令人振奋的研究工作中的三个有力思想:作为视点预测神经瓶颈的三维特征网格、用于处理三维网格分辨率限制的隐式函数,以及用于特征表示无监督训练的对比学习。我们展示了所得三维视觉特征表示能有效跨物体与场景泛化、想象输入视点中被遮挡或缺失的信息、随时间跟踪物体、在三维中对齐语义相关物体,并改进三维物体检测。我们在许多现有的最先进 (SOTA) 三维特征学习与视点预测方法上取得更优表现,那些方法或受限于三维网格空间分辨率,或不试图构建模态不可知三维表示,或因其非卷积瓶颈而无法处理组合式场景变化。
引用
@article{arxiv.2104.03851,
title = {CoCoNets: Continuous Contrastive 3D Scene Representations},
author = {Shamit Lal and Mihir Prabhudesai and Ishita Mediratta and Adam W. Harley and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2104.03851},
year = {2021}
}