中文

深度 W 网络:用深度强化学习求解多目标优化问题

机器学习 2023-06-27 v2 最优化与控制

摘要

在本文中,我们基于深度 Q 网络(DQN)方法引入的进展,将多目标表格型强化学习(RL)算法 W-learning 扩展至大状态空间。W-learning 算法可自然解决多目标环境中多个单一策略之间的竞争。然而,表格版本在具有大状态空间的环境中扩展性不佳。为解决此问题,我们用 DQN 替换底层 Q 表,并提出增加 W 网络(W-Networks)以替代表格型权重(W)表示。我们在两个被广泛接受的多目标 RL 基准——深海寻宝(deep sea treasure)与多目标山地车(multi-objective mountain car)中评估所得的深度 W 网络(DWN)方法。我们表明 DWN 在超越以 DQN 解为形式的基线的同时,解决了多策略间的竞争。此外,我们证明所提算法可在两个测试环境中找到帕累托前沿。

关键词

引用

@article{arxiv.2211.04813,
  title  = {Deep W-Networks: Solving Multi-Objective Optimisation Problems With Deep Reinforcement Learning},
  author = {Jernej Hribar and Luke Hackett and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2211.04813},
  year   = {2023}
}