中文

基于视觉变换器的跨模态统一目标检测器

计算机视觉与模式识别 2023-05-09 v2

摘要

传统系统通常需要不同的模型来处理不同模态,例如一个模型用于 RGB 图像,另一个用于深度图像。近期研究表明,利用跨模态迁移学习可将针对一种模态的单一模型适配于另一种模态。本文中,我们通过将跨/间模态迁移学习与视觉变换器相结合来扩展此方法,开发了一种在不同模态上均取得优越性能的统一检测器。我们的研究设想了一个机器人应用场景,其中统一系统可在变化光照条件下于 RGB 相机与深度传感器间无缝切换。重要的是,该系统无需模型架构或权重更新即可实现此平滑过渡。具体而言,系统在低光照条件(夜间)使用深度传感器,在光照良好环境中使用 RGB 相机与深度传感器两者或仅用 RGB 相机。我们在 SUN RGB-D 数据集上评估了统一模型,并证明其在 SUNRGBD16 类别上相较最先进方法取得了相似或更好的 mAP50 性能,在点云仅模式下性能相当。我们还引入了一种新颖的间模态混合方法,使模型取得显著优于先前方法的结果。我们提供了代码(含训练/推理日志与模型检查点)以促进可复现性与进一步研究。\url{https://github.com/liketheflower/UODDM}

关键词

引用

@article{arxiv.2207.01071,
  title  = {Unified Object Detector for Different Modalities based on Vision Transformers},
  author = {Xiaoke Shen and Ioannis Stamos},
  journal= {arXiv preprint arXiv:2207.01071},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2203.10456