MultiSiam:面向自动驾驶的自监督多实例孪生表征学习
计算机视觉与模式识别
2021-08-30 v1
摘要
多年来自动驾驶备受关注,但实际比预期更难,可能源于模型训练所需标注数据收集的困难。自监督学习(SSL)仅利用无标注数据进行表征学习,或成为提升模型性能的一种有前景的途径。然而,现有 SSL 方法通常依赖于单中心物体假设,这可能不适用于街景等多实例数据集。为缓解该局限,我们提出两个待解决问题:(1) 如何为跨视图一致性定义正样本;(2) 如何在多实例情形下度量相似性。我们首先在随机裁剪时采用 IoU 阈值,将全局不一致转化为局部一致。随后,我们提出两种特征对齐方法,使 2D 特征图可用于多实例相似性度量。此外,我们采用带自注意力的图像内聚类,以进一步挖掘图像内相似性与平移不变性。实验表明,当在 Waymo 数据集上预训练时,我们称为多实例孪生网络(MultiSiam)的方法显著提升了泛化能力,并在包括 Cityscapes 和 BDD100K 在内的自动驾驶基准上取得最先进的迁移性能,而 MoCo、MoCo-v2 和 BYOL 等现有 SSL 方法则出现明显性能下降。通过在大规模自动驾驶数据集 SODA10M 上预训练,MultiSiam 超越了 ImageNet 预训练的 MoCo-v2,展示了领域特定预训练的潜力。代码将发布于 https://github.com/KaiChen1998/MultiSiam。
引用
@article{arxiv.2108.12178,
title = {MultiSiam: Self-supervised Multi-instance Siamese Representation Learning for Autonomous Driving},
author = {Kai Chen and Lanqing Hong and Hang Xu and Zhenguo Li and Dit-Yan Yeung},
journal= {arXiv preprint arXiv:2108.12178},
year = {2021}
}
备注
Accepted by ICCV 2021