机器人何时应说“我不知道”:基于具身问答的放弃基准测试
计算机视觉与模式识别
2025-12-05 v1 人工智能
机器学习
机器人学
摘要
具身问答(EQA)要求智能体解释语言、感知环境并在3D场景中导航以生成响应。现有EQA基准假设每个问题都必须被回答,但具身智能体应知道何时缺乏足够信息来回答问题。本文聚焦于EQA代理的最小要求——放弃:即知道何时暂缓作答。通过对500个人类查询的初始研究,我们发现32.4%的问题包含缺失或不完整的上下文。基于这一初始研究及人类沟通错误的认知理论,我们推导出五类需要放弃的代表性类别:可操作性限制、指代不完整、偏好依赖、信息不可用、以及虚假前提。我们通过让标注员将已就业的问题转换为上述类别中不明确的变体来扩展OpenEQA。 resulting 数据集AbstainEQA包含1,636个标注的放弃案例,配对1,636个原始OpenEQA实例,以实现平衡的评估。在AbstainEQA上进行评估,我们发现即使是最前沿的模型也仅实现42.79%的放弃召回率,而人类达到91.17%。我们还发现,扩大规模、提示工程和推理仅带来有限的提升,精调模型会过度拟合文本线索。总之,这些结果将放弃定位为可靠交互的具身环境的基本前提,并作为有效澄清的必要基础。
引用
@article{arxiv.2512.04597,
title = {When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering},
author = {Tao Wu and Chuhao Zhou and Guangyu Zhao and Haozhi Cao and Yewen Pu and Jianfei Yang},
journal= {arXiv preprint arXiv:2512.04597},
year = {2025}
}