中文

部件如何组装成整体:学习图像的相对组成

计算机视觉与模式识别 2025-12-16 v2 人工智能 机器学习

摘要

物体与其组成部分的构成关系以及物体之间的空间位置关系,为表征学习提供了丰富的信息来源。因此,具有空间感知能力的预训练任务在自监督学习中被积极探索。现有工作通常从网格结构出发,其中预训练任务的目标是预测固定网格内块的绝对位置索引。然而,基于网格的方法难以捕捉真实世界物体构成的流动性和连续性。我们提出PART,一种利用非网格块之间连续相对变换的自监督学习方法。通过建模各部分在连续空间中的关联方式,PART学习图像的相对组成——一种非网格的结构化相对定位,它与绝对外观的关联较弱,能够在部分可见或风格变化等条件下保持连贯性。在需要精确空间理解的任务(如目标检测和时间序列预测)中,PART优于MAE和DropPos等基于网格的方法,同时在全局分类任务上保持竞争力。通过突破网格约束,PART开辟了一条跨数据类型通用自监督预训练的新路径——从图像到EEG信号——在医学成像、视频和音频领域具有潜力。

关键词

引用

@article{arxiv.2506.03682,
  title  = {How PARTs assemble into wholes: Learning the relative composition of images},
  author = {Melika Ayoughi and Samira Abnar and Chen Huang and Chris Sandino and Sayeri Lala and Eeshan Gunesh Dhekane and Dan Busbridge and Shuangfei Zhai and Vimal Thilak and Josh Susskind and Pascal Mettes and Paul Groth and Hanlin Goh},
  journal= {arXiv preprint arXiv:2506.03682},
  year   = {2025}
}