中文

用于以对象为中心学习的有序分组离散表示

计算机视觉与模式识别 2024-12-23 v4

摘要

以对象为中心学习 将密集的图像或视频像素表示为稀疏的对象特征。代表性方法利用由变分自编码器 (VAE) 模板特征组成的离散表示,以抑制像素级信息冗余并引导对象级特征聚合。最新的进展——分组离散表示,进一步将这些模板特征分解为属性。然而,其朴素的通道分组分解方式可能会错误地将属于不同属性的通道分到一组,并将其离散化为次优的模板属性,从而造成信息丢失并损害表达能力。我们提出有序分组离散表示 (OGDR),将属于相同属性的通道组织在一起,以实现从特征到属性的正确分解。在无监督分割实验中,OGDR 在增强经典的基于 Transformer 的 OCL 方法上全面优于 GDR;它甚至改进了最先进的基于扩散的方法。码本 PCA 和表示相似性分析表明,与 GDR 相比,我们的 OGDR 消除了冗余并更好地保留了信息,以引导对象表示学习。源代码可在补充材料中获取。

关键词

引用

@article{arxiv.2409.03553,
  title  = {Organized Grouped Discrete Representation for Object-Centric Learning},
  author = {Rongzhen Zhao and Vivienne Wang and Juho Kannala and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2409.03553},
  year   = {2024}
}

备注

This paper, along with arXiv:2407.01726, was merged into arXiv:2411.02299