探索冲突感知的3D分段预训练中未被触及的采样策略
计算机视觉与模式识别
2024-07-18 v2
摘要
LiDAR-摄像机3D表征预训练在3D感知任务及相关应用中展现出巨大的潜力。然而,该框架中存在两个广泛存在的主要问题:1)仅使用关键帧进行训练。例如,在nuScenes数据集中,大量未成对的LiDAR和摄像机帧未被利用,限制了预训练网络的表征能力。2)对比损失错误地将语义相同但来自不同帧的点和图像区域拉远,扰乱了所学表征的语义一致性。为此,本文提出了一种基于视觉基础模型驱动的样本探索模块,细致选取来自未探索帧中的LiDAR-图像对,丰富原始训练集。我们利用时间戳和VFMs的语义先验来识别良好同步的训练对,并发现具有多样化内容的样本。此外,我们设计了一种基于VFMs语义掩码标签的跨模态和内模态冲突感知对比损失,以避免对语义相似的点和图像区域进行对比。在三个主要公共自动驾驶数据集nuScenes、SemanticKITTI和Waymo上的3D语义分割任务中,我们的方法在mIoU上分别提升了+3.0%、+3.0%和+3.3%。 Furthermore, our approach exhibits adaptable generalization to different 3D backbones and typical semantic masks generated by non-VFM models.
引用
@article{arxiv.2407.07465,
title = {Exploring the Untouched Sweeps for Conflict-Aware 3D Segmentation Pretraining},
author = {Tianfang Sun and Zhizhong Zhang and Xin Tan and Yanyun Qu and Yuan Xie},
journal= {arXiv preprint arXiv:2407.07465},
year = {2024}
}
备注
preprint, version 2