中文

神经组合优化的多动作自我提升

机器学习 2025-10-15 v1

摘要

自我提升已成为神经组合优化(NCO)中的前沿范式,其中模型通过生成和模仿高质� solution 来迭代细化自己的 policy。尽管存在强大的经验性表现,但现有方法面临关键局限性。训练计算成本高昂,因为 policy 更新需要对每个实例进行大量抽样以提取单个 expert trajectory。更根本的问题是,这些方法未能利用涉及多个 agent 协调的组合问题的结构,例如 min-max routing 中的 vehicle 或 scheduling 中的 machine。通过对单动作 trajectory 进行监督,它们未能利用 agent-排列对称性,其中不同的动作序列会产生相同的 solution,阻碍了 generalization 和学习协同行为的能力。我们通过将自我提升扩展到 operate over joint multi-agent actions 来解决这些挑战。我们的 model architecture 在每个 decision 步骤预测 complete agent-task 分配。为显式利用对称性,我们采用 set-prediction loss,supervise policy 在给定 state 上的多个 expert 分配。这一方法提高了 sample efficiency 和模型学习协同行为的能力。此外,由于并行生成 multi-agent actions,它大大加快了自我提升循环的 solution generation 阶段。经验上,我们在几个组合问题上验证了该方法, demonstrating 在最终 solution 的 quality 方面一致性改进,以及相对于 standard self-improvement 的 reduced generation latency。

关键词

引用

@article{arxiv.2510.12273,
  title  = {Multi-Action Self-Improvement for Neural Combinatorial Optimization},
  author = {Laurin Luttmann and Lin Xie},
  journal= {arXiv preprint arXiv:2510.12273},
  year   = {2025}
}