中文

揭示语言智能体在规划任务中的瓶颈

人工智能 2024-10-17 v1 计算与语言

摘要

自人工智能诞生以来,自动化规划一直是持续的追求。基于精选问题解决器的早期规划智能体能够为特定任务提供精确解答,但缺乏泛化能力。大型语言模型(LLMs)及其强大的推理能力的出现,重新点燃了对自动化规划的兴趣,通过自动为给定任务生成合理解答。然而,尽管已有研究和我们的实验表明,当前语言智能体仍缺乏人类水平的规划能力。即便是最先进的推理模型OpenAI o1,在一项复杂真实世界规划基准测试中也仅达到15.6%。这突显了一个关键问题:阻碍语言智能体实现人类水平规划的因素是什么?尽管已有研究已凸显智能体规划性能弱的事实,但更深层次的问题及所提出策略的机制和局限性仍不充分理解。在本工作中,我们应用特征归因研究,识别出两大关键因素限制智能体规划:约束作用有限和问题影响力减弱。我们还发现,尽管当前策略有助于缓解这些挑战,但并未完全解决,表明智能体在实现人类智能水平方面仍需迈长一步。

关键词

引用

@article{arxiv.2410.12409,
  title  = {Revealing the Barriers of Language Agents in Planning},
  author = {Jian Xie and Kexun Zhang and Jiangjie Chen and Siyu Yuan and Kai Zhang and Yikai Zhang and Lei Li and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2410.12409},
  year   = {2024}
}

备注

Work in Progress