中文

ContextFusion 与 Bootstrap:提升基于 Slot Attention 的对象中心学习方法

计算机视觉与模式识别 2025-09-03 v1

摘要

人类关键能力之一是将场景分解为 distinct 对象并利用其关系以理解环境。对象中心学习旨在以无监督方式模拟此过程。最近,基于 slot attention 的框架在该领域中崭露头角,已被广泛应用于各种下游任务。然而,现有基于 slot attention 的方法面临两个关键限制:(1) 缺乏高层次语义信息。在当前方法中,图像区域根据低级特征如颜色和纹理分配给 slot,这使得模型对低级特征过于敏感,限制其对对象轮廓、形状或其他语义特征的理解。(2) 无法对编码器进行微调。当前方法需要在训练期间保持稳定的特征空间以实现从 slot 的重建,这限制了有效对象中心学习所需的灵活性。为此,我们提出了 novel 的 ContextFusion 阶段和 Bootstrap 分支,可无缝集成到现有基于 slot attention 的模型中。在 ContextFusion 阶段,我们利用前景和背景的语义信息,纳入提供关于它们的额外语境线索的辅助指示器,以丰富超越低级特征的语义内容。在 Bootstrap 分支中,我们将特征适应从原始重建阶段解耦,引入 bootstrap 策略来训练特征适应机制,实现更灵活的适应。实验结果表明,我们的方法在 simulated 和 real-world 数据集上显著提升了不同 SOTA 基于 slot attention 模型的性能。

关键词

引用

@article{arxiv.2509.02032,
  title  = {ContextFusion and Bootstrap: An Effective Approach to Improve Slot Attention-Based Object-Centric Learning},
  author = {Pinzhuo Tian and Shengjie Yang and Hang Yu and Alex C. Kot},
  journal= {arXiv preprint arXiv:2509.02032},
  year   = {2025}
}