中文

利用动作序列相似性改进大语言模型规划

人工智能 2025-05-05 v1

摘要

规划对于人工智能系统在虚拟和现实世界中前瞻性地确定行动方案以达到目标至关重要。近期关于大语言模型(LLMs)的研究揭示了其在各种任务中的规划能力。然而,上下文中哪些信号会影响模型性能仍不清楚。在这项工作中,我们探索了如何通过上下文学习来改进模型的规划能力,具体而言,是哪些信号有助于选择范例。通过大量实验,我们观察到常用的问题相似性可能会导致误报,即产生截然不同的计划,从而误导模型。为此,我们提出利用计划层面的动作序列相似性来采样和筛选范例。我们提出了GRASE-DC:一个两阶段流程,首先重新采样高动作序列相似性的范例,然后通过动态聚类对所选范例进行精炼,以实现相关性和多样性的平衡。我们的实验结果证实,GRASE-DC在各种规划任务上取得了显著的性能提升(绝对准确率提升高达约11-40个百分点,且平均所需范例数量减少了27.3%)。通过GRASE-DC* + VAL,即我们迭代地应用GRASE-DC与验证器,我们甚至能将性能再提升18.9%。广泛的分析验证了GRASE-DC在各种骨干LLM以及经典规划和自然语言规划基准测试上性能提升的一致性。GRASE-DC能够在使用更简单问题作为范例的情况下,将更难问题的规划准确率在随机基线上提升约24个绝对百分点。这证明了其泛化到分布外问题的能力。

关键词

引用

@article{arxiv.2505.01009,
  title  = {Improving Large Language Model Planning with Action Sequence Similarity},
  author = {Xinran Zhao and Hanie Sedghi and Bernd Bohnet and Dale Schuurmans and Azade Nova},
  journal= {arXiv preprint arXiv:2505.01009},
  year   = {2025}
}

备注

25 pages, 11 figures