AMIGO:智能体多图像定位Oracle基准测试
机器学习
2026-03-31 v1 人工智能
摘要
智能体视觉语言模型越来越多地通过扩展交互来行动,但大多数评估仍聚焦于单图像、单轮次的正确性。我们提出AMIGO(Agentic Multi-Image Grounding Oracle Benchmark),一个用于在视觉相似图像库中识别隐藏目标的长期基准测试。在AMIGO中,Oracle私下选择一张目标图像,模型必须通过一系列聚焦属性的Yes/No/Unsure问题来恢复该图像,且遵循严格协议,对无效动作以Skip进行惩罚。该设置强调:(i) 不确定性下的问题选择,(ii) 跨轮次的一致性约束追踪,以及(iii) 随证据积累的细粒度判别。AMIGO还支持受控的Oracle不完美性,以探测在不一致反馈下的鲁棒性与验证行为。我们以Guess My Preferred Dress任务实例化AMIGO,并报告涵盖结果与交互质量的指标,包括识别成功率、证据验证、效率、协议合规性、噪声容忍度以及轨迹级诊断。
引用
@article{arxiv.2603.28662,
title = {AMIGO: Agentic Multi-Image Grounding Oracle Benchmark},
author = {Min Wang and Ata Mahjoubfar},
journal= {arXiv preprint arXiv:2603.28662},
year = {2026}
}