中文

分组离散表示指导对象中心学习

计算机视觉与模式识别 2024-12-23 v3

摘要

类似人类感知视觉场景为对象,对象中心学习(Object-Centric Learning, OCL)可以将稠密图像或视频抽象为稀疏的对象级特征。基于 Transformer 的 OCL 由于利用离散表示(通过对图像或视频特征图中的噪声特征进行离散化获得,方法是使用来自码本的模板特征)而在处理复杂纹理方面表现良好。然而,将特征视为最小单元忽略了它们的组成属性,导致模型泛化受阻;使用自然数索引特征则丢失了属性层面的共性和特征,导致模型收敛的启发式方法减弱。我们提出分组离散表示(Grouped Discrete Representation, GDR),通过将特征分组为属性并用元组编号来解决这些问题。在不同查询初始化、数据集模态性和模型架构的广泛实验中,GDR consistently 改善了收敛性和泛化性。可视化显示,我们的方法有效捕获了特征中属性级信息。源代码将在接受后提供。

关键词

引用

@article{arxiv.2407.01726,
  title  = {Grouped Discrete Representation Guides Object-Centric Learning},
  author = {Rongzhen Zhao and Vivienne Wang and Juho Kannala and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2407.01726},
  year   = {2024}
}

备注

This paper, along with arXiv:2409.03553, was merged into arXiv:2411.02299