中文

TourPlanner:基于约束门控强化学习的竞争性共识旅行规划框架

人工智能 2026-01-09 v1 计算与语言 机器学习

摘要

旅行规划是一个复杂的决策过程,需要综合多方面的信息来构建行程。然而,现有的旅行规划方法面临几个挑战:(1)在修剪候选兴趣点(POI)的同时保持高召回率;(2)单一推理路径限制了旅行规划可行解空间内的探索能力;(3)同时优化硬约束和软约束仍然是一个重大难题。为了应对这些挑战,我们提出了 TourPlanner,这是一个具有多路径推理和约束门控强化学习特性的综合框架。具体而言,我们首先引入了个性化召回与空间优化(PReSO)工作流,以构建空间感知的候选 POI 集合。随后,我们提出了竞争性共识思维链(CCoT),这是一种多路径推理范式,可提高探索可行解空间的能力。为了进一步完善计划,我们将基于 sigmoid 的门控机制整合到强化学习阶段,该机制仅在满足硬约束后动态地优先考虑软约束的满足。在旅行规划基准上的实验结果表明,TourPlanner 实现了 SOTA 性能,在可行性和用户偏好对齐方面均显著优于现有方法。

关键词

引用

@article{arxiv.2601.04698,
  title  = {TourPlanner: A Competitive Consensus Framework with Constraint-Gated Reinforcement Learning for Travel Planning},
  author = {Yinuo Wang and Mining Tan and Wenxiang Jiao and Xiaoxi Li and Hao Wang and Xuanyu Zhang and Yuan Lu and Weiming Dong},
  journal= {arXiv preprint arXiv:2601.04698},
  year   = {2026}
}