中文

局部审视:以对象为中心的视觉Transformer作为高效分割的基础模型

计算机视觉与模式识别 2025-07-08 v2

摘要

当前最先进的分割模型在聚焦特定对象之前会编码整个图像,因此浪费了计算资源——尤其是在高分辨率场景中分割小对象时。我们提出FLIP(类中央凹输入分块),一种参数高效的视觉模型,通过受生物启发的自上而下注意力实现对象分割。FLIP从输入中有选择地采样以感兴趣对象为中心的多分辨率图像块,从而将高分辨率处理分配给对象中心,同时保持较粗糙的周边上下文。这种非网格、尺度不变的设计使FLIP以大幅优势超越META的Segment Anything模型(SAM):在参数量减少超过1000倍的情况下,FLIP-Tiny(0.51M参数)达到78.24%的平均IoU,而SAM-H(641.1M参数)达到75.41%的IoU。FLIP-Large甚至达到80.33%的平均IoU(96.6M参数),且运行速度仍比SAM-H快约6倍。我们在总共六个基准上进行了评估。在五个已建立的基准(Hypersim、KITTI-360、OpenImages、COCO、LVIS)中,FLIP始终优于SAM及其各种变体。在我们新提出的ObjaScale数据集中(该数据集通过包含占图像面积0.0001%至25%的对象来对尺度不变性进行压力测试),我们展示了FLIP能准确分割非常小的对象,而现有模型则严重失败。FLIP为实时、以对象为中心的视觉应用开辟了新的可能性,并提供了更高的能效。我们相信FLIP可以作为一个强大的基础模型,因为它非常适合随时间跟踪对象,例如当集成到基于槽位的场景分割架构中时。

关键词

引用

@article{arxiv.2502.02763,
  title  = {Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation},
  author = {Manuel Traub and Martin V. Butz},
  journal= {arXiv preprint arXiv:2502.02763},
  year   = {2025}
}