中文

GuessingGame:衡量大语言模型在开放式问题中的信息量

计算与语言 2025-09-25 v1 人工智能

摘要

我们引入了 GuessingGame,一种用于评估大语言模型(LLMs)在开放式、开放域环境中作为策略性提问者的协议。一个猜测者 LLM 通过向一个神谕者提出自由形式的问题来识别一个隐藏对象,过程中没有预设选项或候选列表。为了衡量问题质量,我们提出了两种信息增益(IG)指标:一种贝叶斯方法,利用 LLM 评分的相关性跟踪语义概念上的信念更新;以及一种基于熵的方法,通过 ConceptNet 过滤候选对象。这两种指标均与模型无关,并支持事后分析。在涉及多个模型和提示策略的 858 场游戏中,更高的 IG 强烈预示着效率:IG 每增加一个标准差,预期游戏长度减少 43%。由 IG 引导的提示约束,例如强制问题多样性,使较弱的模型也能显著提升性能。这些结果表明,LLM 的提问能力既可衡量也可改进,并且对于交互式推理至关重要。

引用

@article{arxiv.2509.19593,
  title  = {GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models},
  author = {Dylan Hutson and Daniel Vennemeyer and Aneesh Deshmukh and Justin Zhan and Tianyu Jiang},
  journal= {arXiv preprint arXiv:2509.19593},
  year   = {2025}
}

备注

EMNLP 2025, 17 pages, 2 figures