中文

室内场景语义分割的自监督预训练

计算机视觉与模式识别 2022-10-06 v1

摘要

为室内场景地图赋予语义信息的能力,是执行目标驱动导航、物体搜索或物体重排等不同任务的机器人智能体的组成部分。最先进的方法使用深度卷积神经网络(DCNNs)来预测图像的语义分割,作为这些任务的有用表示。语义分割的准确性取决于来自目标环境的标注数据的可用性与数量,或弥合测试与训练环境之间域差距的能力。我们提出 RegConsist,一种用于语义分割模型自监督预训练的方法,利用智能体在陌生环境中移动并配准多视角的能力。给定用于像素级数据关联的空间和时间一致性线索,我们使用一种对比学习的变体来训练 DCNN 模型,以从目标环境中的 RGB 视角预测语义分割。所提方法优于在 ImageNet 上预训练的模型,并在使用为完全相同任务但在不同数据集上训练的模型时取得有竞争力的性能。我们还进行了多种消融研究以分析并证明所提方法的有效性。

关键词

引用

@article{arxiv.2210.01884,
  title  = {Self-supervised Pre-training for Semantic Segmentation in an Indoor Scene},
  author = {Sulabh Shrestha and Yimeng Li and Jana Kosecka},
  journal= {arXiv preprint arXiv:2210.01884},
  year   = {2022}
}