中文

基于深度注意力模型的参数化多智能体路由

机器学习 2025-07-31 v1

摘要

我们提出了一个可扩展的深度学习框架,用于参数化顺序决策问题(ParaSDM),其中多个智能体共同优化离散动作策略和共享的连续参数。此设置的一个关键子类出现在设施位置和路径优化(FLPO)中,其中多智能体系统必须同时确定最优路径和设施位置,以最小化网络内的累积运输成本。由于其混合的离散-连续结构和高度非凸目标,FLPO问题是NP难的。为此,我们将最大熵原理(MEP)与一种称为最短路径网络(SPN)的神经策略模型相集成——这是一种对称不变的编码器-解码器,既近似MEP解答,又能够高效地对共享参数进行梯度优化。SPN在策略推断和梯度计算方面相较于MEP基线实现了最高可达100倍的加速,在广泛的Problem规模范围内实现约6%的平均最优间隙。我们的FLPO方法比元启发式基线的成本降低超过10倍,运行速度显著更快,同时以1500倍的加速速度匹配Gurobi的最优成本——为ParaSDM问题树立了新的技术范畴。这些结果凸显了结构化深度模型在解决大规模混合整数优化任务方面的强大能力。

关键词

引用

@article{arxiv.2507.22338,
  title  = {Parametrized Multi-Agent Routing via Deep Attention Models},
  author = {Salar Basiri and Dhananjay Tiwari and Srinivasa M. Salapaka},
  journal= {arXiv preprint arXiv:2507.22338},
  year   = {2025}
}

备注

This work is under submission to AAAI 2026. Please cite the arXiv version until the final version is published