simCrossTrans:一种基于 ConvNets 或视觉 Transformer 的简易跨模态迁移学习目标检测方法
摘要
迁移学习在计算机视觉(CV)与自然语言处理(NLP)中广泛应用并取得巨大成功。多数迁移学习系统基于相同模态(如 CV 中的 RGB 图像与 NLP 中的文本)。然而,跨模态迁移学习(CMTL)系统十分稀少。本工作中,我们研究从 2D 到 3D 传感器的 CMTL,以探索仅使用 3D 传感器系统的性能上限,这类系统在机器人导航中至关重要且在低光照场景下表现良好。尽管多数从 2D 到 3D 视觉的 CMTL 流程复杂且基于卷积神经网络(ConvNets),我们的方法易于实现与扩展,并同时基于 ConvNets 与视觉 Transformer(ViTs):1)通过将点云转换为伪图像,我们可使用基于 2D 图像预训练模型中几乎相同的网络。这使我们的系统易于实现与扩展。2)近期 ViTs 展现出良好性能及对遮挡的鲁棒性,而遮挡正是 3D 视觉系统性能不佳的关键原因之一。我们探索了模型规模相近的 ViT 与 ConvNet 以考察性能差异。我们将该方法命名为 simCrossTrans:基于 ConvNets 或 ViTs 的简易跨模态迁移学习。在 SUN RGB-D 数据集上的实验表明:借助 simCrossTrans,基于 ConvNets 与 ViTs 分别获得 与 的绝对性能提升。我们还观察到基于 ViTs 的方法比基于 ConvNets 的高出 ,显示了 simCrossTrans 结合 ViT 的威力。结合 ViTs 的 simCrossTrans 以 mAP50 的大幅优势超越先前最优(SOTA)。相较于先前基于 RGB 图像的 2D 检测 SOTA,我们仅使用深度图像的系统仅有 的差距。代码、训练/推理日志与模型已公开于 https://github.com/liketheflower/simCrossTrans
引用
@article{arxiv.2203.10456,
title = {simCrossTrans: A Simple Cross-Modality Transfer Learning for Object Detection with ConvNets or Vision Transformers},
author = {Xiaoke Shen and Ioannis Stamos},
journal= {arXiv preprint arXiv:2203.10456},
year = {2022}
}