中文

将槽位引导至物体:迈向稳定鲁棒的物体中心学习

计算机视觉与模式识别 2023-04-03 v1

摘要

物体中心学习(OCL)旨在通过将场景表示为一组物体中心表征的集合,来实现对场景的通用且组合式的理解。OCL 也被扩展到多视图图像和视频数据集,以利用多图像数据中的几何或时间信息来施加各种数据驱动的归纳偏置。单视图图像所携带的关于如何解耦给定场景的信息少于视频或多视图图像。因此,由于难以施加归纳偏置,面向单视图图像的 OCL 仍然具有挑战性,导致物体中心表征的学习不一致。为此,我们提出了一种用于单视图图像的新型 OCL 框架,即经由引导的槽位注意力(SLot Attention via SHepherding,SLASH),它在 Slot Attention 之上由两个简单而有效的模块组成。新模块分别为注意力精炼核(ARK)和中间点预测与编码器(IPPE),可防止槽位被背景噪声分散注意力,并指示槽位应聚焦的位置以促进物体中心表征的学习。我们还提出了一种用于 OCL 的弱半监督方法,同时我们提出的框架在推理时无需任何辅助标注即可使用。实验表明,我们提出的方法能够实现物体中心表征的一致学习,并在四个数据集上取得强劲性能。代码可在 \url{https://github.com/object-understanding/SLASH} 获取。

关键词

引用

@article{arxiv.2303.17842,
  title  = {Shepherding Slots to Objects: Towards Stable and Robust Object-Centric Learning},
  author = {Jinwoo Kim and Janghyuk Choi and Ho-Jin Choi and Seon Joo Kim},
  journal= {arXiv preprint arXiv:2303.17842},
  year   = {2023}
}