利用外源深度信息改进像素级对比学习
计算机视觉与模式识别
2022-11-21 v1
摘要
近年来,基于对比学习(CL)的自监督表示学习备受关注。这是由于其在多种后续任务(特别是分类)上取得了优异结果,且不需要大量标注样本。然而,大多数参考 CL 算法(如 SimCLR 和 MoCo,以及 BYOL 和 Barlow Twins)并不适用于像素级下游任务。一种称为 PixPro 的现有解决方案提出了一种像素级方法,其基于对同一图像的正负图像裁剪对根据它们在整幅图像中的距离进行过滤。我们认为,通过引入外源数据提供的语义信息作为额外的选择过滤器,可进一步增强该思路,该过滤器可用于(在训练时)改进像素级正/负样本的选择。在本文中,我们将聚焦于深度信息,它可通过使用深度估计网络获得或从可用数据(立体视觉、视差运动、LiDAR 等)测量得到。场景深度可提供有意义的线索,依据像素深度区分属于不同物体的像素。我们展示了在对比损失中使用该外源信息可带来改进结果,且学习到的表示更好地贴合物体形状。此外,我们引入了一种多尺度损失,缓解了寻找适应不同物体尺寸的训练参数的问题。我们在钻孔图像破裂分割(Breakout Segmentation on Borehole Images)上证明了我们思路的有效性,相较 PixPro 提升 1.9%,相较监督基线提升近 5%。我们进一步在 ScanNet 的室内场景分割任务与 CityScapes 的室外场景上验证了我们的技术(分别较 PixPro 提升 1.6% 和 1.1%)。
引用
@article{arxiv.2211.10177,
title = {Improving Pixel-Level Contrastive Learning by Leveraging Exogenous Depth Information},
author = {Ahmed Ben Saad and Kristina Prokopetc and Josselin Kherroubi and Axel Davy and Adrien Courtois and Gabriele Facciolo},
journal= {arXiv preprint arXiv:2211.10177},
year = {2022}
}
备注
Accepted for WACV 2023