中文

多智能体指针变换器:基于序列到序列的强化学习用于多车动态提货送达问题

机器学习 2025-12-18 v2

摘要

本文聚焦于合作式多车辆动态提货送达问题(带随机请求,MVDPDPSR),提出一种基于序列到序列的端到端集中式决策框架,命名为多智能体指针变换器(MAPT)。MVDPDPSR是车辆路径问题的一个扩展,是一种时空系统优化问题,广泛应用于按需配送等场景。传统操作研究方法在处理大规模动态问题时面临计算复杂度和时间效率瓶颈。虽然现有强化学习方法取得了一些进展,但仍面临若干挑战:(1)多个车辆的独立解码无法建模联合动作分布;(2)特征提取网络难以捕获实体间关系;(3)联合动作空间指数级增长。为此,我们设计了MAPT框架,采用Transformer编码器提取实体表示,结合带指针网络的Transformer解码器以自回归方式生成联合动作序列,并引入关系感知注意力模块以捕获实体间关系。此外,我们引入信息性先验以引导模型决策,促进有效探索。在8个数据集上的实验表明,MAPT在性能和计算时间方面均显著优于现有基线方法。

关键词

引用

@article{arxiv.2511.17435,
  title  = {Multi-Agent Pointer Transformer: Seq-to-Seq Reinforcement Learning for Multi-Vehicle Dynamic Pickup-Delivery Problems},
  author = {Zengyu Zou and Jingyuan Wang and Yixuan Huang and Junjie Wu},
  journal= {arXiv preprint arXiv:2511.17435},
  year   = {2025}
}

备注

15 pages