中文

在真实世界场景中基于 Slot 的以对象为中心的表示学习

计算机视觉与模式识别 2025-09-30 v1

摘要

人工智能的一个核心目标是将场景表示为离散对象的组合,从而实现细粒度、可控的图像和视频生成。然而,领先的扩散模型将图像整体处理并依赖文本条件,这为对象级编辑造成了不匹配。本论文引入了一个框架,将强大的预训练扩散模型适配于以对象为中心的合成,同时保留其生成能力。我们确定了一个核心挑战:在全局场景连贯性与解耦的对象控制之间取得平衡。我们的方法将轻量级的基于 slot 的条件化集成到预训练模型中,在提供特定对象操作的同时保留其视觉先验。对于图像,SlotAdapt 通过为背景/风格引入寄存器 token 和为对象引入 slot 条件化模块来增强扩散模型,减少了文本条件偏差,并在对象发现、分割、组合编辑和可控图像生成方面取得了最先进的结果。我们进一步将该框架扩展到视频。使用不变 Slot 注意力(ISA)将对象身份与姿态分离,并使用基于 Transformer 的时间聚合器,我们的方法在跨帧时保持了一致的对象表示和动态。这在无监督视频对象分割和重建方面产生了新的基准,并支持高级编辑任务,如对象移除、替换和插入,而无需显式监督。总体而言,这项工作为图像和视频的以对象为中心的生成建模建立了一种通用且可扩展的方法。通过连接基于对象的人类感知与机器学习,它扩展了创意、科学和实用领域中交互式、结构化和用户驱动的生成工具的设计空间。

关键词

引用

@article{arxiv.2509.24652,
  title  = {Learning Object-Centric Representations Based on Slots in Real World Scenarios},
  author = {Adil Kaan Akan},
  journal= {arXiv preprint arXiv:2509.24652},
  year   = {2025}
}

备注

PhD Thesis, overlap with arXiv:2507.20855 and arXiv:2501.15878