基于语义容忍对比损失的自监督图像到点蒸馏
计算机视觉与模式识别
2023-03-27 v2
摘要
一种用于感知任务学习 3D 表示的有效框架是通过对比学习蒸馏丰富的自监督图像特征。然而,面向自动驾驶数据集的图像到点表示学习面临两个主要挑战:1)自相似性丰富,导致对比损失将语义相似的点与图像区域推远,从而扰乱所学表示的局部语义结构;2)严重的类不平衡,使得预训练被过度表示的类别主导。我们提出通过一种新颖的语义容忍图像到点对比损失来缓解自相似性问题,该损失考虑正样本与负样本图像区域之间的语义距离,以最小化对语义相似点与图像区域的对比。此外,我们通过设计一种类无关的均衡损失来解决类不平衡问题,该损失通过聚合的样本到样本语义相似度度量来近似类不平衡程度。我们证明,我们的语义容忍对比损失结合类平衡在所有评估设置下均改进了最先进的 2D 到 3D 表示学习在 3D 语义分割上的表现。我们的方法在广泛的 2D 自监督预训练模型上持续优于最先进的 2D 到 3D 表示学习框架。
引用
@article{arxiv.2301.05709,
title = {Self-Supervised Image-to-Point Distillation via Semantically Tolerant Contrastive Loss},
author = {Anas Mahmoud and Jordan S. K. Hu and Tianshu Kuai and Ali Harakeh and Liam Paull and Steven L. Waslander},
journal= {arXiv preprint arXiv:2301.05709},
year = {2023}
}
备注
Accepted in CVPR 2023