中文

通过大语言模型测试时扩展生成符号世界模型

人工智能 2025-05-09 v2

摘要

解决复杂规划问题需要大语言模型 (LLM) 显式建模状态转换,以避免规则违规、遵守约束并确保最优性——这一任务受自然语言固有歧义的限制。为克服此类歧义,计划领域定义语言 (PDDL) 作为一种规划抽象,实现精确且形式化的状态描述。借助 PDDL,可生成包含经典搜索算法(如 A*)可无缝应用的符号世界模型。然而,直接使用当前大语言模型生成 PDDL 域 remains 挑战所在,因缺乏 PDDL 训练数据。为此,我们提出通过扩展大语言模型的测试时计算来提升其 PDDL 推理能力,从而实现高质量 PDDL 域的生成。具体而言,我们引入一种简单而有效的算法,首先采用最佳-N 抽样方法提高初始解的质量,然后通过语言化机器学习对解进行精细化优化。我们的方法在 PDDL 域生成任务上显著优于 o1-mini,两个任务(即从自然语言描述或 PDDL 问题生成 PDDL 域)成功率均超过 50%。该方法无需额外训练。凭借 PDDL 作为状态抽象,我们的方法在几乎所有竞赛级规划任务中超越当前最先进的方法。

关键词

引用

@article{arxiv.2502.04728,
  title  = {Generating Symbolic World Models via Test-time Scaling of Large Language Models},
  author = {Zhouliang Yu and Yuhuan Yuan and Tim Z. Xiao and Fuxiang Frank Xia and Jie Fu and Ge Zhang and Ge Lin and Weiyang Liu},
  journal= {arXiv preprint arXiv:2502.04728},
  year   = {2025}
}

备注

Accepted by TMLR2025 (32 pages, 6 figures)