从被动推理到主动推理:大型语言模型能否在信息不完全时提出正确问题?
机器学习
2025-06-11 v1 人工智能
计算与语言
摘要
虽然现有基准测试横跨多个领域探测大型语言模型(LLM)的推理能力,但它们主要评估被动推理,即提供模型达到解决方案所需的全部信息。相较之下,主动推理——即LLM必须与外部系统交互以获取遗漏的证据或数据——几乎未得到系统性关注。为填补这一空白,我们提出AR-Bench基准测试,旨在评估LLM的主动推理技能。AR-Bench包含三类任务——侦探案件、情境谜题和猜数字——模拟真实世界的、具代理性的情景,衡量commonsense、逻辑和符号推理挑战的表现。经验评估表明,当代LLM在主动推理方面存在显著困难:它们经常未能获取或利用解决任务所需的信息。这一差距凸显了其被动与主动推理能力之间的显著分歧。此外,消融研究表明,即便是基于树的搜索或后训练方法,也仅带来有限的提升,远远不足以满足实际部署的需求。总体而言,这些发现凸显了亟需发展主动推理方法的重要性,例如纳入交互式学习、实时反馈循环以及面向环境的训练目标。该基准已公开于:https://github.com/tmlr-group/AR-Bench。
引用
@article{arxiv.2506.08295,
title = {From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?},
author = {Zhanke Zhou and Xiao Feng and Zhaocheng Zhu and Jiangchao Yao and Sanmi Koyejo and Bo Han},
journal= {arXiv preprint arXiv:2506.08295},
year = {2025}
}
备注
Accepted by ICML 2025