从网页到像素:将智能搜索引入视觉感知
计算机视觉与模式识别
2026-05-13 v1
摘要
视觉感知将高层语义理解与像素级感知相连接,但大多数现有设置假设目标识别的决定性证据已经存在于图像中或来自冻结的模型知识。我们研究一种更实用且更具挑战性的开放世界情形:可见对象必须先从外部事实、近期事件、长尾实体或多跳关系中被解析,然后才能被定位。我们将这一挑战形式化为感知深层研究,引入WebEye,一个包含可验证证据、知识密集型查询、精确的框/掩码标注以及三个任务视图:搜索式定位、搜索式分割和搜索式VQA。WebEyes包含120张图像、473个标注对象实例、645个唯一问答对以及1,927个任务样本。我们进一步提出了Pixel-Searcher,一种智能搜索转像素的工作流程,通过解析隐藏目标身份并将其绑定到框、掩码或准确答案。实验表明,Pixel-Searcher在所有三个任务视图中实现了最强的开源性能,而失败主要来自证据获取、身份解析和视觉实例绑定。
引用
@article{arxiv.2605.12497,
title = {From Web to Pixels: Bringing Agentic Search into Visual Perception},
author = {Bokang Yang and Xinyi Sun and Kaituo Feng and Xingping Dong and Dongming Wu and Xiangyu Yue},
journal= {arXiv preprint arXiv:2605.12497},
year = {2026}
}
备注
Project page: https://pixel-searcher.github.io/