先发制人,再提问?——构建探索与行动类似人的理性智能体
计算与语言
2026-03-09 v2 人工智能
摘要
许多新兴的AI应用——从科学发现到医学诊断——都要求智能体以战略性方式寻求信息:形成假设、提出有针对性的问题并在不确定性下作出决策。在资源有限的高风险场景中,语言模型(LMs)是否表现出理性行为?基于对人类认知的洞见,本文开发了方法以评估和提升智能体的探索与行动能力。首先,我们引入一种以决策为导向的对话任务,称为协作战舰游戏。在该任务中,舰长必须在探索(提问)与行动(开火)之间进行平衡,而侦察官必须提供准确、具有上下文 grounding 的答案。与人类玩家(N=42)进行比较后发现,许多LM智能体在提出有信息量的问题、提供准确答案以及识别高效益动作方面存在困难。为此,我们发展了受贝叶斯实验设计(BED)启发的新型蒙特卡洛推理策略。对于侦察官智能体,本方法相较于仅基于LM的基线可提升准确率最高可达14.7个百分点;对于舰长智能体,能将预期信息增益(EIG)提升至最高0.227位(94.2%达到可实现的噪声上限)。综合这些组件后,系统可实现更精准的打击(+0.303-0.374 F1),并使较弱的LM(如Llama-4-Scout)能够超过人类玩家(胜率从8%提升至82%)和前沿模型(相较于GPT-5的0%提升至67%),仅需约1%的GPT-5成本。在Guess Who?任务中,我们也复制了这些发现,方法显著提升了准确率(+28.3-42.4个百分点),表明其对构建信息寻求智能体具有广泛适用性。
引用
@article{arxiv.2510.20886,
title = {Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People},
author = {Gabriel Grand and Valerio Pepe and Jacob Andreas and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2510.20886},
year = {2026}
}
备注
ICLR 2026