Segment This Thing:面向高效点提示分割的中央凹化词元化
计算机视觉与模式识别
2025-06-16 v1 图像与视频处理
摘要
本文提出了 Segment This Thing (STT),一种新型高效图像分割模型,旨在给定单一点提示的情况下生成单一分割区域。我们没有遵循以往工作通过减小模型尺寸来提升效率的做法,而是通过对输入图像进行中央凹化来提升效率。给定一张图像和一个点提示,我们提取以该提示为中心的裁剪区域,并应用一种新颖的可变分辨率图块词元化方法,其中图块的下采样率随着距提示距离的增加而提高。该方法产生的图像词元数量远少于均匀图块词元化。因此,我们可以在不减小模型尺寸的情况下大幅降低分割的计算成本。此外,中央凹化使模型聚焦于感兴趣区域,这是一种潜在有用的归纳偏置。我们表明,我们的 Segment This Thing 模型比以往工作更高效,同时在分割基准上保持竞争力。它可以在消费级硬件上轻松以交互式帧率运行,因此是增强现实或机器人应用的有前景的工具。
引用
@article{arxiv.2506.11131,
title = {Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation},
author = {Tanner Schmidt and Richard Newcombe},
journal= {arXiv preprint arXiv:2506.11131},
year = {2025}
}