完成但未确定:在具身智能体中分离世界完成与自终止
人工智能
2026-05-15 v3
摘要
标准的具身评估不独立评分智能体在剧集关闭时是否正确提交任务完成,一种我们称为终端承诺的能力。行为上不同的失败——从未完成任务、完成但未停止、以及在缺乏充分证据的情况下报告成功——都归结为相同的基准失败。我们引入 VIGIL,这是一个使终端承诺独立可测的评估框架。在 VIGIL 的默认协议下,智能体仅观察 egocentric RGB,接收不到动作成功信号,必须以语义报告结束每个剂集,该报告基于隐藏的世界状态进行确定性检查。这产生了两个独立的得分:world-state completion(W)和 benchmark success(B),其中 B 还要求正确的终端报告。这种解耦使得四种结果类别可区分:missed execution、post-attainment drift、unsupported commitment 和 verified success。在 1000 个冻结剂集上测试 20 个模型,具有相似 W 的系统在 B 上相差最高可达 19.7 百分点:一个模型将已实现的状态转换为正确的报告,而另一个在几乎相同的执行下会在靠近目标而不关闭的情况下继续运行。进一步的动作反馈干预测试了这种分离:执行导向的信号在 W 上普遍有所改善,但在尚未将终端报告 grounding 到已实现状态的模型中,仍然存在承诺失败。VIGIL 提供了一个使终端承诺独立可见和可评分的协议。
引用
@article{arxiv.2605.08747,
title = {Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents},
author = {Ying Chen and Lihuang Fang and Rui Jiang and Mingxu Wang and Zhifeng Gu and Lei Yi and Jie Chen},
journal= {arXiv preprint arXiv:2605.08747},
year = {2026}
}