学习与利用验证器提升预训练语言模型的规划能力
计算与语言
2023-05-29 v1 人工智能
摘要
文献中广泛声称预训练大语言模型(LLM)具有涌现推理能力。然而,近期研究发现其规划能力仍存疑。通过使用GPT-2的实验,我们实证表明微调基线的性能仍然较差,因为它违反了所生成计划中动作的前置条件。为提升微调LLM的规划能力,我们训练了一个验证器,可将在特定状态下动作分类为有效或无效。通过从同一数据集随机采样动作,我们生成无效动作示例,随后用于训练可检查动作适用性的验证器。在生成器多样采样与可剪枝无效轨迹的验证器共同作用下,我们在Blocksworld领域展示了成功率显著提升。此外,我们表明将GPT-2生成器本身微调以创建验证器比微调基础GPT-2泛化更好。最后,我们研究了采样温度的作用,其可用于控制探索-利用权衡。
引用
@article{arxiv.2305.17077,
title = {Learning and Leveraging Verifiers to Improve Planning Capabilities of Pre-trained Language Models},
author = {Daman Arora and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2305.17077},
year = {2023}
}