中文

TP-RAG:面向时空感知旅行规划的检索增强型大型语言模型代理基准

计算与语言 2025-12-12 v1

摘要

大型语言模型(LLM)在自动化旅行规划方面显示出巨大的潜力,但往往难以满足细致的时空理性需求。虽然已有基准测试侧重基本计划有效性,却忽视了诸如路径效率、景点吸引力和实时适应性等关键方面。本文引入TP-RAG,首个针对检索增强、时空感知旅行规划设计的基准测试。我们的数据集包含2,348个真实旅行查询、85,575个细粒度标注景点以及18,784个高质量旅行轨迹参考来源于网络旅游文档,支持动态且情境感知的规划。通过大量实验,我们揭示了整合参考轨迹显著提升旅行计划的空间效率和景点理性,而由于参考来源冲突和噪声数据,普适性和鲁棒性仍面临挑战。为此,我们提出EvoRAG——一种演化框架,强大地融合多样检索到的轨迹与LLM内在推理能力。EvoRAG实现了最先进的性能,提升了时空合规性,减少了常识违规。我们的工作凸显了将Web知识与LLM驱动优化相融合的潜力,为可靠且自适应的旅行规划代理铺平了道路。

关键词

引用

@article{arxiv.2504.08694,
  title  = {TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning},
  author = {Hang Ni and Fan Liu and Xinyu Ma and Lixin Su and Shuaiqiang Wang and Dawei Yin and Hui Xiong and Hao Liu},
  journal= {arXiv preprint arXiv:2504.08694},
  year   = {2025}
}