LLM规划中的泛化差距:测试与验证器奖励强化学习
人工智能
2026-01-22 v1 机器学习
摘要
近期工作表明,微调后的大语言模型(LLM)可以在PDDL规划任务上实现高有效规划率。然而,这反映的是可迁移的规划能力还是特定领域的记忆,仍不清楚。在本工作中,我们使用来自10个IPC 2023领域的40,000个领域-问题-规划元组微调了一个1.7B参数的LLM,并评估了域内和跨域泛化。虽然该模型在域内条件下达到了82.9%的有效规划率,但在两个未见领域上达到了0%。为了分析这一失败,我们引入了三种诊断性干预措施,即(i)实例级符号匿名化,(ii)紧凑规划序列化,以及(iii)使用VAL验证器作为成功导向的强化信号的验证器奖励微调。符号匿名化和紧凑序列化在保持规划语义的情况下导致了显著的性能下降,从而揭示了对表面表示的强敏感性。验证器奖励微调在监督训练轮次的一半时就达到了性能饱和,但并未改善跨域泛化。在所探索的配置中,域内性能稳定在80%左右,而跨域性能崩溃,这表明我们的微调模型在此设置中严重依赖领域特定模式,而非可迁移的规划能力。我们的结果凸显了基于LLM的规划中持续存在的泛化差距,并提供了研究其原因的诊断工具。
引用
@article{arxiv.2601.14456,
title = {On the Generalization Gap in LLM Planning: Tests and Verifier-Reward RL},
author = {Valerio Belcamino and Nicholas Attolino and Alessio Capitanelli and Fulvio Mastrogiovanni},
journal= {arXiv preprint arXiv:2601.14456},
year = {2026}
}
备注
9 pages, 4 figures, 3 tables, 2 pages of supplementary materials. Submitted to a conference implementing a double-blind review process