分组离散表示指导对象中心学习
计算机视觉与模式识别
2024-12-23 v3
摘要
类似人类感知视觉场景为对象,对象中心学习(Object-Centric Learning, OCL)可以将稠密图像或视频抽象为稀疏的对象级特征。基于 Transformer 的 OCL 由于利用离散表示(通过对图像或视频特征图中的噪声特征进行离散化获得,方法是使用来自码本的模板特征)而在处理复杂纹理方面表现良好。然而,将特征视为最小单元忽略了它们的组成属性,导致模型泛化受阻;使用自然数索引特征则丢失了属性层面的共性和特征,导致模型收敛的启发式方法减弱。我们提出分组离散表示(Grouped Discrete Representation, GDR),通过将特征分组为属性并用元组编号来解决这些问题。在不同查询初始化、数据集模态性和模型架构的广泛实验中,GDR consistently 改善了收敛性和泛化性。可视化显示,我们的方法有效捕获了特征中属性级信息。源代码将在接受后提供。
关键词
引用
@article{arxiv.2407.01726,
title = {Grouped Discrete Representation Guides Object-Centric Learning},
author = {Rongzhen Zhao and Vivienne Wang and Juho Kannala and Joni Pajarinen},
journal= {arXiv preprint arXiv:2407.01726},
year = {2024}
}
备注
This paper, along with arXiv:2409.03553, was merged into arXiv:2411.02299