基于级联信息披露的通用问题解决能力评估框架
计算与语言
2025-08-01 v1
摘要
虽然问答 (QA) 基准性能是一种自动且可扩展的方法来比较大型语言模型 (LLM),但它是间接评估其底层问题解决能力的方式。因此,我们提出了一种基于“级联信息披露”的全面且可通用的框架,提供更准确地估计模型问题解决能力的估计,同时保持可扩展性和自动化。该方法以阶段性方式收集模型响应,每个阶段揭示问题的部分信息,以诱发 LLM 中的通用推理。我们发现,我们的方法不仅为 LLM 之间的更好比较提供了帮助,还比标准 QA 范式诱导更好的中间痕迹。我们通过在多样化推理和知识密集型 QA 数据集上进行实验,比较不同规模和家族的 LLM 来验证这一行为。我们的做法缩小了在标准 QA 评估设置中观察到的性能差距,表明流行的间接 QA 评估范式会高估模型之间性能差异的程度。我们进一步通过大量消除实验验证了我们的发现。
引用
@article{arxiv.2507.23776,
title = {Cascaded Information Disclosure for Generalized Evaluation of Problem Solving Capabilities},
author = {Yunxiang Yan and Tomohiro Sawada and Kartik Goyal},
journal= {arXiv preprint arXiv:2507.23776},
year = {2025}
}
备注
Under review