中文

面向多目标优化的深度强化学习

神经与进化计算 2020-04-28 v2 最优化与控制

摘要

本研究提出一种利用深度强化学习(DRL)求解多目标优化问题(MOPs)的端到端框架,称为 DRL-MOA。采用分解思想将 MOP 分解为一组标量优化子问题。随后将每个子问题建模为神经网络。所有子问题的模型参数依据基于邻域的参数迁移策略与 DRL 训练算法协同优化。帕累托最优解可直接通过训练好的神经网络模型获得。具体而言,本工作将子问题建模为指针网络,使用 DRL-MOA 方法求解多目标旅行商问题(MOTSP)。进行了大量实验以研究 DRL-MOA,并与多种基准方法比较。研究发现,一旦获得训练好的模型,其可扩展到新遇到的问题而无需重新训练模型。解可通过神经网络的一次简单前向计算直接得到;因此无需迭代,MOP 总能在合理时间内求解。所提方法为通过 DRL 求解 MOP 提供了新途径。与现有多目标优化方法相比,它展现出一系列新特性,如强泛化能力与快速求解速度。实验结果表明所提方法在模型性能与运行时间上的有效性与竞争力。

关键词

引用

@article{arxiv.1906.02386,
  title  = {Deep Reinforcement Learning for Multi-objective Optimization},
  author = {Kaiwen Li and Tao Zhang and Rui Wang},
  journal= {arXiv preprint arXiv:1906.02386},
  year   = {2020}
}