中文

REN:从基于补丁的图像编码器生成快速高效的区域编码

计算机视觉与模式识别 2025-11-04 v2

摘要

我们提出了区域编码网络(REN),是一个快速且有效的模型,用于基于点提示生成区域图像表示。最近的一些方法将无类别分段器(如 SAM)与基于补丁的图像编码器(如 DINO)组合,以产生紧凑且高效的区域表示,但由于分段步骤导致高计算成本。REN 采用轻量级模块直接生成区域标记,实现了 60 倍的标记生成速度和 35 倍的内存节省,同时提升了标记质量。它使用少量的跨注意力块,以点提示作为查询,以基于补丁的图像编码器的特征作为键值,生成对应提示对象区域的标记。我们使用三种主流编码器-DINO、DINOv2 和 OpenCLIP 进行训练,并表明其可扩展至其他编码器,无需专门训练。我们在语义分割和检索任务上评估了 REN,在性能和紧凑性方面均优于原始编码器,同时在速度上显著优于基于 SAM 的区域方法。值得注意的是,REN 在具有挑战性的 Ego4D VQ2D 基准测试中取得了最新成绩,并在 Visual Haystacks 的单针挑战中超越了专有 LMM。代码和模型已公开:https://github.com/savya08/REN。

关键词

引用

@article{arxiv.2505.18153,
  title  = {REN: Fast and Efficient Region Encodings from Patch-Based Image Encoders},
  author = {Savya Khosla and Sethuraman TV and Barnett Lee and Alexander Schwing and Derek Hoiem},
  journal= {arXiv preprint arXiv:2505.18153},
  year   = {2025}
}