中文

LLM 代理能否为 drafting 长期计划提供可靠依赖?以 TravelPlanner 为例

人工智能 2024-08-13 v1 机器学习

摘要

大型语言模型(LLMs)由于其有前景的泛化和涌现能力,使自治代理更接近人工通用智能(AGI)。然而,针对 LLM 代理行为、可能的失败原因以及如何改进它们的研究仍不足,尤其是在要求严苛的实际规划任务方面。本文作为填补这一空白的努力之一,呈现我们使用真实基准 TravelPlanner 的研究,其中代理必须满足多个约束来生成准确计划。我们利用此基准来回答四个关键研究问题:(1)LLM 代理在推理和规划方面,是否足够稳健以处理冗长和噪声的上下文?(2)少量样本提示是否会对 LLM 代理在长上下文场景中的性能产生不利影响?(3)我们能否依赖细化来提高计划?(4)用正负反馈对 LLMs 进行微调是否会带来进一步的改进?我们的全面实验表明,首先,尽管 LLMs 能够处理大量参考信息和少量样本示例,但它们常常未能注意到长上下文的关键部分;其次,它们仍在分析长计划方面存在困难,无法提供准确的反馈以进行细化;第三ly,我们提出了反馈感知微调(FAFT),该方法利用正负反馈,相较于监督式微调(SFT)实现了显著提升。我们的发现为社区提供了关于各种与实际规划应用相关方面的深入见解。

关键词

引用

@article{arxiv.2408.06318,
  title  = {Can We Rely on LLM Agents to Draft Long-Horizon Plans? Let's Take TravelPlanner as an Example},
  author = {Yanan Chen and Ali Pesaranghader and Tanmana Sadhu and Dong Hoon Yi},
  journal= {arXiv preprint arXiv:2408.06318},
  year   = {2024}
}

备注

13 pages, 2 figures, 4 tables