中文

重温大语言模型的旅行规划能力

人工智能 2026-05-06 v1

摘要

旅行规划作为长程推理的关键任务,暴露了大语言模型显著的不足。然而,现有基准和评估主要以端到端方式评估最终方案,缺乏可解释性,难以分析失败的根本原因。为弥合这一差距,我们将旅行规划分解为五个基本原子子能力,包括约束提取、工具使用、方案生成、错误识别和错误纠正。我们实现了一种解耦的评估协议,利用准确中间上下文严格隔离这些组成部分,从而测量无级联错误噪声的原子性能边界。我们的结果突显了明显的性能差异:尽管大语言模型在提取显式约束方面相当熟练,但在推断隐式、开放世界要求方面却感到困难。此外,他们在方案生成中表现出结构偏见,并因自我纠正无效而受影响,表现为过度敏感和错误地坚持错误观点。这些发现为改进大语言模型的推理和规划能力提供了精确的方向。

关键词

引用

@article{arxiv.2605.03308,
  title  = {Revisiting the Travel Planning Capabilities of Large Language Models},
  author = {Bo-Wen Zhang and Jin Ye and Peng-Yu Hua and Jia-Wei Cao and Jie-Jing Shao and Yu-Feng Li and Lan-Zhe Guo},
  journal= {arXiv preprint arXiv:2605.03308},
  year   = {2026}
}