TripScore:面向细粒度评估的真实世界旅行规划基准与奖励
人工智能
2025-10-17 v3 计算与语言
摘要
旅行规划是一项有价值但复杂的任务,即使对先进的大语言模型(LLMs)也构成重大挑战。虽然最近的基准测试在评估LLM的规划能力方面取得了进展,但它们在评估旅行计划的可行性、可靠性和参与度方面往往不足。我们引入了一个全面的旅行规划基准,将细粒度标准统一为单一奖励,实现计划质量的直接比较以及与强化学习(RL)的无缝集成。我们的评估器与旅行专家标注具有中等一致性(60.75%),并优于多个LLM-as-judge基线。我们还发布了一个包含4,870个查询的大规模数据集,其中包括219个真实世界的自由格式请求,以泛化到真实的用户意图。使用该基准,我们在多样化的方法和LLMs上进行了广泛实验,包括测试时计算、神经符号方法、监督微调和通过GRPO的强化学习。在基础模型中,RL通常优于仅提示和监督基线,提高了行程可行性并产生了更高的统一奖励分数。
引用
@article{arxiv.2510.09011,
title = {TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation},
author = {Yincen Qu and Huan Xiao and Feng Li and Gregory Li and Hui Zhou and Xiangying Dai and Xiaoru Dai},
journal= {arXiv preprint arXiv:2510.09011},
year = {2025}
}