中文

光流增强无监督定位与分割

计算机视觉与模式识别 2023-07-26 v1

摘要

无监督定位与分割是长久以来的机器人视觉挑战,描述了自主机器人在无标注数据情况下学习将图像分解为单个物体的关键能力。这些任务十分重要,因为密集图像人工标注稀缺,且终身学习中对不断演化的物体类别进行适应的前景广阔。近期多数方法聚焦于利用视觉外观连续性作为物体线索,通过对自监督视觉 transformer(ViT)提取的特征进行空间聚类实现。本工作中,我们借助运动线索,受共同命运原则启发——即具有相似运动的像素往往属于同一物体。我们提出一种新的损失项形式,利用无标注视频中的光流,鼓励自监督 ViT 特征在其对应空间位置具有相似运动时彼此接近,反之则远离。我们使用所提损失函数对最初在静态图像上训练的视觉 transformer 进行微调。我们的微调过程通过线性探测在无监督语义分割上优于最先进技术,且未使用任何标注数据。该过程在无监督物体定位与语义分割基准上也展现出优于原始 ViT 网络的性能。

关键词

引用

@article{arxiv.2307.13640,
  title  = {Optical Flow boosts Unsupervised Localization and Segmentation},
  author = {Xinyu Zhang and Abdeslam Boularias},
  journal= {arXiv preprint arXiv:2307.13640},
  year   = {2023}
}

备注

Accepted at IROS2023