中文

基于自适应超像素编码的表示学习

计算机视觉与模式识别 2025-08-25 v1 人工智能

摘要

深度学习视觉模型通常针对特定模态设计,常依赖于特定领域假设,例如几乎所有现有视觉模型所使用的网格结构。在本工作中,我们提出一种基于Transformer的自监督模型,称为自适应超像素编码(Adaptive Superpixel Coding,ASC)。我们模型的关键洞察在于克服传统视觉Transformer依赖固定大小和非自适应分块划分的局限性。ASC采用自适应超像素层,动态调整以适应底层图像内容。我们分析了使该方法有效的关键属性,并发现该方法在标准图像下游任务基准测试中优于广泛使用的替代方案。

关键词

引用

@article{arxiv.2508.15959,
  title  = {Representation Learning with Adaptive Superpixel Coding},
  author = {Mahmoud Khalil and Ahmad Khalil and Alioune Ngom},
  journal= {arXiv preprint arXiv:2508.15959},
  year   = {2025}
}