QuestBench:LLM 是否能够在推理任务中提出正确的问题以获取信息?
人工智能
2025-10-28 v2 计算与语言
机器学习
摘要
大语言模型(LLM)在数学和逻辑推理基准测试中展现出惊人的性能。尽管许多工作 largely 假设任务是明确定义的,但现实世界的查询往往是不明确的,只有通过获取缺失信息才能解决。我们将此信息获取问题形式化为缺失变量赋值的约束满足问题(CSP)。当只有一个必要的变量赋值缺失时,我们可以评估 LLM 是否能够识别获取所需信息的最小必要问题。我们提出 QuestBench,包含一组通过提出不超过一个问题即可解决的不明确推理任务,包括:(1)Logic-Q:包含一个缺失命题的逻辑推理任务,(2)Planning-Q:初始状态部分观察到的 PDDL 规划问题,(3)GSM-Q:人工标注的小学数学问题中包含一个未知变量,(4)GSME-Q:GSM-Q 的方程版本。LLM 必须从多个选项中选择正确的澄清问题。虽然当前模型在 GSM-Q 和 GSME-Q 上表现出色,但在 Logic-Q 和 Planning-Q 上仅达到 40%-50% 的准确率。分析显示,解决明确定义推理问题的能力并不足以在本基准测试中取得成功:即使在完全明确的版本中,模型也难以识别正确的问题。这一发现凸显了针对模型信息获取能力进行特定优化的必要性。
引用
@article{arxiv.2503.22674,
title = {QuestBench: Can LLMs ask the right question to acquire information in reasoning tasks?},
author = {Belinda Z. Li and Been Kim and Zi Wang},
journal= {arXiv preprint arXiv:2503.22674},
year = {2025}
}
备注
Code and dataset are available at \url{https://github.com/google-deepmind/questbench}