面向多目标优化的深度强化学习
神经与进化计算
2020-04-28 v2 最优化与控制
摘要
本研究提出一种利用深度强化学习(DRL)求解多目标优化问题(MOPs)的端到端框架,称为 DRL-MOA。采用分解思想将 MOP 分解为一组标量优化子问题。随后将每个子问题建模为神经网络。所有子问题的模型参数依据基于邻域的参数迁移策略与 DRL 训练算法协同优化。帕累托最优解可直接通过训练好的神经网络模型获得。具体而言,本工作将子问题建模为指针网络,使用 DRL-MOA 方法求解多目标旅行商问题(MOTSP)。进行了大量实验以研究 DRL-MOA,并与多种基准方法比较。研究发现,一旦获得训练好的模型,其可扩展到新遇到的问题而无需重新训练模型。解可通过神经网络的一次简单前向计算直接得到;因此无需迭代,MOP 总能在合理时间内求解。所提方法为通过 DRL 求解 MOP 提供了新途径。与现有多目标优化方法相比,它展现出一系列新特性,如强泛化能力与快速求解速度。实验结果表明所提方法在模型性能与运行时间上的有效性与竞争力。
引用
@article{arxiv.1906.02386,
title = {Deep Reinforcement Learning for Multi-objective Optimization},
author = {Kaiwen Li and Tao Zhang and Rui Wang},
journal= {arXiv preprint arXiv:1906.02386},
year = {2020}
}