基于 LLM-Modulo 框架的鲁棒规划:旅行规划案例研究
人工智能
2024-06-03 v1
摘要
随着大型语言模型 (LLM) 的适用范围不断拓展 Beyond 传统文本处理任务,人们对其在规划和推理任务中所表现出的能力引起日益关注,这类任务往往是系统 2 认知Competencies的领域。尽管这些模型被认为具有广泛的多功能性,但研究社区仍在探索有效策略来充分利用这些模型处理此类复杂领域。近期论文引入了 LLM-Modulo 框架,这是一个具有重要意义的进步,提出了一种概念框架以增强 LLM 集成到各种规划和推理活动中的效果。本工作论文深入探讨了将此框架在旅行规划领域中的实际应用,呈现了一个具体的实现案例。我们采用 OSU NLP 小组开发的旅行规划基准测试,该基准测试用于评估 LLM 在基于用户以自然语言呈现的查询生成有效行程方面的性能。尽管链式思考、ReAct 和 Reflexion 等流行方法在提升 LLM 推理能力方面成效有限(分别实现 0%, 0.6% 和 0% 的准确率),但我们对 LLM-Modulo 框架在旅行规划领域的实现,使 GPT4-Turbo 的基线性能提升了 4.6 倍,对于较旧的模型如 GPT3.5-Turbo 从 0% 提升至 5%。此外,我们还突出了 LLM 在规划流程中其他有用角色的作用,如从 LLM-Modulo 中建议的从业方式,这些角色可以可靠地实现,如从 LLM 中提取有用批评意见和对批评意见进行改写的功能。
关键词
引用
@article{arxiv.2405.20625,
title = {Robust Planning with LLM-Modulo Framework: Case Study in Travel Planning},
author = {Atharva Gundawar and Mudit Verma and Lin Guan and Karthik Valmeekam and Siddhant Bhambri and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2405.20625},
year = {2024}
}