PuzzlePlex:基准测试探索基础模型的推理与规划能力
人工智能
2025-10-09 v1 计算与语言
摘要
本工作考察了基础模型在复杂动态环境中的推理与规划能力及其可扩展性。我们引入PuzzlePlex,一个通过多样化拼图评估这些能力的基准测试。PuzzlePlex包含15种类型的拼图,包括难度各异的确定性与随机游戏,以及单人与双人情境。PuzzlePlex框架为每款游戏提供完整环境,支持扩展以生成更具挑战性的实例以适应基础模型的演进。此外,我们实现了定制化的游戏策略用于对比。基于此基准测试,我们开发了细粒度度量指标,深入分析前沿基础模型在两种作�中表现:指令驱动式与代码驱动式。进一步系统性地调查了其扩展极限。我们的发现表明,推理模型在指令驱动式情境中表现优于其他模型,而代码驱动式执行面临更大挑战但提供了可扩展且高效的替代方案。PuzzlePlex实现了针对性评估,指导未来在推理、规划与泛化方面的改进。
引用
@article{arxiv.2510.06475,
title = {PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles},
author = {Yitao Long and Yuru Jiang and Hongjun Liu and Yilun Zhao and Jingchen Sun and Yiqiu Shen and Chen Zhao and Arman Cohan and Dennis Shasha},
journal= {arXiv preprint arXiv:2510.06475},
year = {2025}
}