中文

超越行程规划:面向多轮对话与工具使用的真实世界旅行任务基准

人工智能 2026-04-22 v3

摘要

旅行规划是测试大语言模型(LLM)规划与工具使用能力的天然真实世界任务。尽管已有工作研究了LLM在旅行规划上的表现,但现有设置仍与现实需求存在差距,主要问题在于领域覆盖有限、对多轮对话中用户隐式偏好的建模不足,以及缺乏对智能体能力边界的评估。为弥补这些差距,我们提出了TravelBench\textbf{TravelBench},一个面向真正现实世界\textit{真正现实世界}旅行规划的基准。我们从真实场景中收集用户查询、用户偏好和工具,并构建了三个子任务——单轮\textit{单轮}多轮\textit{多轮}不可解\textit{不可解}——以评估智能体在真实环境中的三项核心能力:(1) 独立解决问题,(2) 与用户交互以挖掘隐式偏好,以及(3) 识别能力边界。为实现稳定的工具调用和可复现的评估,我们缓存了真实的工具调用结果,并构建了一个集成十种旅行相关工具的沙盒环境,使智能体能够组合这些工具来解决大多数实际的旅行规划问题。我们在TravelBench上评估了多个LLM,发现即使是先进的模型在不同能力上也表现出不平衡的性能。我们进一步的系统验证证明了所提基准的稳定性。TravelBench为推进面向真实世界旅行规划的LLM智能体研究提供了一个实用且可复现的基准。

关键词

引用

@article{arxiv.2512.22673,
  title  = {Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks},
  author = {Xiang Cheng and Yulan Hu and Xiangwen Zhang and Lu Xu and Lide Tan and Zheng Pan and Xin Li and Yong Liu},
  journal= {arXiv preprint arXiv:2512.22673},
  year   = {2026}
}

备注

Accepted to the ACL 2026 Main Conference. Camera-ready version