Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games
太阳与恒星天体物理
2026-01-27 v1
摘要
大型语言模型(LLMs)在许多任务中表现出色,但仍在一个关键能力方面受限,即LLM-based智能体询问解决用户请求模糊性的好问题。虽然先前工作通过单词游戏探索了信息寻求行为,但现有基准缺乏提供基于信息增益(Information Gain, IG)的最终和中间信号的全面评估框架。此外,这些基准很少提供使用链律思考(chain-of-thought reasoning)与不使用链律思考的模型之间的系统性比较。我们提出了一个多轮对话框架,定量测量LLMs通过yes/no问题在层次化知识图谱环境中收集信息的效果。我们的框架采用三个相互作用的LLM智能体询问问题、回答问题并更新假设空间。我们采用IG作为主要指标,基于香农熵来评估每个回合以及累计的查询有效性。我们在一个组织为五级分类的地理学Guess My City游戏中实现了我们的框架,并评估了多个LLM变体在完全可观测和部分可观测条件下,带和不带链律思考的情况下的表现。我们的实验表明,在评估的模型中,具备显式推理能力的模型在每个回合获得更高的IG,并在更少的步骤中解决问题,特别是在部分可观测条件下。对推理痕迹的分析揭示了,较小的模型通过更积极地探索候选问题来弥补容量有限的不足,而较大的模型则在选择最优查询方面更具自信,生成的候选问题具有更大的潜在IG。
引用
@article{arxiv.2601.17715,
title = {Evolution of Stellar Activity and Habitable Zone II: Ca H&K Emissions of Late-type Dwarfs},
author = {Henggeng Han and Song Wang and Xue Li and Chuanjie Zheng and Jiahui Wang and Jifeng Liu},
journal= {arXiv preprint arXiv:2601.17715},
year = {2026}
}
备注
APJS Accepted