AQA-Bench:评估大型语言模型顺序推理能力的交互式基准
计算与语言
2025-06-23 v2 人工智能
机器学习
摘要
本文介绍了AQA-Bench,一个新颖的基准,用于评估大型语言模型(LLM)在算法上下文中的顺序推理能力,例如深度优先搜索(DFS)。我们评估基准的关键特征在于其交互式评估协议——例如,在DFS中,每个节点的连接边的可用性取决于模型遍历到该节点,从而要求LLM能够有效记住已访问节点,并考虑未来步骤中可能的环境反馈来制定后续移动策略。我们使用三种不同的算法全面构建了AQA-Bench,即二分搜索、深度优先搜索和广度优先搜索,并评估了14种不同LLM的顺序推理能力。我们的研究揭示了一些有趣的发现:(1) 闭源模型如GPT-4和Gemini通常表现出更强的顺序推理能力,显著优于开源LLM。(2) 在交互环境中,简单地提供上下文示例可能会因过度拟合示例而无意中损害少样本性能。(3) 与其使用另一个测试用例中的最优步骤作为上下文示例,当前测试用例中遵循最优策略的极少量前驱步骤可以显著提升小模型的性能。(4) 弱模型和强模型之间的性能差距很大程度上是由于弱模型无法良好启动。(5) 性能与模型大小之间的缩放相关性并不总是显著,有时甚至呈现逆趋势。我们希望我们的研究能够推动未来在理解和增强LLM顺序推理能力方面的工作。代码可在https://github.com/UCSC-VLAA/AQA-Bench获取。
引用
@article{arxiv.2402.09404,
title = {AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability},
author = {Siwei Yang and Bingchen Zhao and Cihang Xie},
journal= {arXiv preprint arXiv:2402.09404},
year = {2025}
}