中文

FlySearch:探索视觉语言模型的探索方式

计算机视觉与模式识别 2025-10-22 v3 机器学习 机器人学

摘要

真实世界是混乱且非结构化的。发现关键信息往往需要主动的、以目标为导向的探索。视觉语言模型(VLMs)这种最近在许多困难任务中作为流行的零样学习工具,是否能在此类条件下有效工作尚不明了。本文通过引入 FlySearch,一个用于在复杂场景中搜索和导航以寻找物体的 3D、户外、写实环境来回答这一问题。我们定义了三个难度不同的情景集合,并观察到最新 VLMs 甚至无法可靠地解决最简单的探索任务,随着任务难度增加,与人类性能之间的差距也在增大。我们识别了一组中心性原因, ranging from vision hallucination, through context misunderstanding, to task planning failures,并表明其中一些原因可以通过微调来解决。我们公开发布了基准、情景以及底层代码。

关键词

引用

@article{arxiv.2506.02896,
  title  = {FlySearch: Exploring how vision-language models explore},
  author = {Adam Pardyl and Dominik Matuszek and Mateusz Przebieracz and Marek Cygan and Bartosz Zieliński and Maciej Wołczyk},
  journal= {arXiv preprint arXiv:2506.02896},
  year   = {2025}
}

备注

NeurIPS 2025 Datasets and Benchmarks track