中文

TripTailor:面向个性化旅行规划的真实场景基准

人工智能 2025-08-05 v1

摘要

大语言模型(LLMs)的持续演进和增强的推理能力提升了其在复杂任务中的作用,尤其是在旅行规划领域,用户对提供个性化高质量行程的需求日益增长。然而,当前的基准测试往往依赖于不切实际的模拟数据,无法反映 LLM 生成行程与真实世界行程之间的差异。现有的评估指标主要侧重约束条件,难以全面评估旅行计划的整体质量。为此,我们引入 TripTailor,一个专为真实场景下的个性化旅行规划设计的基准测试。该数据集包含超过 50 万个真实世界的旅游景点(POIs)和近 4000 个多样化旅行行程,配有详细信息,提供了更真实的评估框架。实验表明,最新 SOTA LLM 生成的行程中,不足 10% 能达到人类水平。此外,我们确定了旅行规划中的几个关键挑战,包括方案的可行性、合理性以及个性化定制。我们希望 TripTailor 能推动开发能够理解和满足用户需求,同时生成实用行程的旅行规划智能体。我们的代码和数据集已提供 at https://github.com/swxkfm/TripTailor

关键词

引用

@article{arxiv.2508.01432,
  title  = {TripTailor: A Real-World Benchmark for Personalized Travel Planning},
  author = {Yuanzhe Shen and Kaimin Wang and Changze Lv and Xiaoqing Zheng and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2508.01432},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings