中文

通过解缠槽注意力学习全局对象中心表示

计算机视觉与模式识别 2024-11-05 v1

摘要

人类能够辨识不同环境中物体的场景无关特征,使其能够快速识别在光照、视角、大小和位置等因素变化下的物体,并能想象同一物体在多种设置下的完整图像。现有对象中心学习方法仅提取场景相关的对象中心表示,缺乏跨场景识别同一物体的能力。此外,一些现有方法则放弃了处理复杂场景的单独对象生成能力。本文引入一种新颖的对象中心学习方法,使 AI 系统具备跨场景识别物体和生成包含特定物体的多样场景的能力,通过学习一组全局对象中心表示。为学习包含对象全局不变属性(即完整外观和形状)的全局对象中心表示,本文设计了解缠槽注意力模块,将场景特征转换为场景相关属性(如比例、位置和方向)和场景无关表示(即外观和形状)。实验结果证实了所提出方法的有效性,显示出在全局对象中心表示学习、对象识别、特定对象场景生成和场景分解方面展现出卓越的专业能力。

关键词

引用

@article{arxiv.2410.18809,
  title  = {Learning Global Object-Centric Representations via Disentangled Slot Attention},
  author = {Tonglin Chen and Yinxuan Huang and Zhimeng Shen and Jinghao Huang and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2410.18809},
  year   = {2024}
}

备注

Global Object-Centric Representations, Object Identification, Unsupervised Learning, Disentangled Learning