DeepTravel:面向自主旅行规划智能体的端到端智能体强化学习框架
人工智能
2025-09-29 v1
摘要
旅行规划(TP)智能体近期作为与外部工具和资源交互以生成旅行行程的新型构建模块出现,确保了良好的用户体验。尽管具有优势,现有研究依赖手工设计的提示和固定的智能体工作流,限制了更灵活和自主的TP智能体。本文提出DeepTravel,一个用于构建自主旅行规划智能体的端到端智能体强化学习框架,能够自主规划、执行工具并反思工具响应,以在多步推理中探索、验证和优化中间行动。为实现这一点,我们首先构建了一个强大的沙箱环境,通过缓存交通、住宿和兴趣点数据,促进TP智能体训练而不受真实世界API限制(如输出不一致)的影响。此外,我们开发了一个分层奖励建模系统,其中轨迹级别验证器首先检查时空可行性并筛选不满足的旅行行程,然后轮次级别验证器进一步验证行程细节与工具响应的一致性,从而实现高效且精确的奖励服务。最后,我们提出了回复增强强化学习方法,使TP智能体能够定期从失败经验缓冲区重放,从而展现出显著的智能体能力。将训练好的TP智能体部署在DiDi企业解决方案应用上,并进行了全面的在线和离线评估,结果表明DeepTravel使小规模LLM(如Qwen3 32B)在旅行规划任务中显著超越现有前沿LLM,如OpenAI o1、o3和DeepSeek R1。
引用
@article{arxiv.2509.21842,
title = {DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents},
author = {Yansong Ning and Rui Liu and Jun Wang and Kai Chen and Wei Li and Jun Fang and Kan Zheng and Naiqiang Tan and Hao Liu},
journal= {arXiv preprint arXiv:2509.21842},
year = {2025}
}
备注
Under review