用策略游戏追踪大语言模型推理过程:面向规划、修正与资源受限决策的框架
人工智能
2025-06-16 v1
摘要
大型语言模型(LLMs)越来越多地用于需要复杂推理的任务。大多数基准测试关注最终结果,但忽略了中间推理步骤——如规划、修正和资源受限条件下的决策。我们认为,测量这些内部过程对于理解模型行为和提高可靠性至关重要。我们提出使用策略游戏作为自然的评估环境:封闭的、基于规则的系统,具有明确的状态、有限的资源和自动反馈。我们引入了一个框架,从三个核心维度评估大语言模型:规划、修正和资源受限决策。为实现这一目标,我们定义了超越胜率的指标,包括过度修正风险率、修正成功率、改进斜率和超预算比。在12个领先模型的4320轮对抗性实验中,ChatGPT-o3-mini取得了最高的综合得分,胜率为74.7%、修正成功率为78.6%、改进斜率为0.041。相比之下,Qwen-Plus尽管过度修正风险率为81.6%,但仅赢得25.6%的对局——主要由于资源过度使用。我们还观察到过度修正风险率与修正成功率之间存在负相关(Pearson r = -0.51, p = 0.093),表明更频繁的编辑并不总是能改善结果。我们的发现强调了不仅评估大语言模型做出什么决策,还评估它们如何得出这些决策的价值。
引用
@article{arxiv.2506.12012,
title = {Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making},
author = {Xiaopeng Yuan and Xingjian Zhang and Ke Xu and Yifan Xu and Lijun Yu and Jindong Wang and Yushun Dong and Haohan Wang},
journal= {arXiv preprint arXiv:2506.12012},
year = {2025}
}
备注
19 pages, 7 figures. Under review