中文

AsgardBench —— 在最小反馈下评估视觉锚定交互式规划

人工智能 2026-03-20 v2 计算机视觉与模式识别 机器人学

摘要

我们提出 AsgardBench,旨在评估视觉锚定的、高层次动作序列生成和交互式规划,具体聚焦于基于视觉观察在执行期间进行 plan adaptation。 在具身 AI 基准的图景中,AsgardBench 目标是具象化交互式规划能力类别,这种能力比离线高层次规划更为复杂, requires agents 修订计划以响应环境反馈,却与低层次执行保持 distinct。 不同于以往具身 AI 基准将推理与导航混合或提供丰富纠正反馈以替代感知的做法,AsgardBench 将 agent 输入限制为图像、动作历史和轻量级成功/失败信号,在没有低层次控制噪声的受控模拟器中隔离交互式规划。该基准包含 108 个任务实例,spanning 12 种任务类型,每个任务类型通过对象状态、放置和场景配置进行系统性变异。这些受控变异创建了条件分支,单个指令可能根据 agent 观察到的内容需要不同的动作序列,从而强调执行期间的条件分支和 plan 修复。我们评估了领先的视觉语言模型,结果显示在没有视觉输入的情况下性能会急剧下降,揭示了视觉锚定和状态跟踪的弱点,最终削弱了交互式规划。我们的基准聚焦于更窄的问题:模型是否能够实际使用所看到的内容来调整计划,当情况并非如期时?

关键词

引用

@article{arxiv.2603.15888,
  title  = {AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback},
  author = {Andrea Tupini and Lars Liden and Reuben Tan and Yu Wang and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2603.15888},
  year   = {2026}
}

备注

19 figures, 6 tables, including appendix