中文

LocateAnything:基于并行框解码的快速高质量视觉语言定位

计算机视觉与模式识别 2026-05-28 v2 人工智能 机器学习 机器人学

摘要

视觉语言模型 (VLM) 通常将视觉定位和检测表述为一个坐标令牌生成问题,将每个二维框序列化为多个一维令牌,这些令牌在很大程度上是独立学习和解码的。这种逐令牌解码与框几何结构的耦合特性不匹配,并且由于严格的顺序生成而造成了实际的推理瓶颈。我们引入了 LocateAnything,这是一个基于并行框解码 (PBD) 的统一生成式定位和检测框架。通过将边界框和点等几何元素作为原子单元在单步中解码,LocateAnything 保持了框内几何一致性并实现了显著的并行性。我们表明,PBD 提高了解码吞吐量和定位精度。我们进一步开发了一个可扩展的数据引擎,并策划了 LocateAnything-Data,这是一个包含超过 1.38 亿个训练样本的大规模数据集,显著增加了高精度定位的数据多样性。广泛的评估表明,LocateAnything 推进了速度-精度前沿,在提高跨不同基准的高 IoU 定位质量的同时,实现了显著更高的解码吞吐量。结果凸显了并行框解码和大规模训练数据在实现高效且精确的统一视觉定位和检测方面的互补优势。

关键词

引用

@article{arxiv.2605.27365,
  title  = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal= {arXiv preprint arXiv:2605.27365},
  year   = {2026}
}

备注

fix github link