中文

gTLO:一种广义非线性多目标深度强化学习方法

机器学习 2022-04-12 v1 人工智能 系统与控制 系统与控制

摘要

在现实世界的决策优化中,通常必须考虑多个相互竞争的目标。遵循经典强化学习,这些目标必须被组合成单一的奖励函数。相比之下,多目标强化学习(MORL)方法从各目标奖励向量中学习。在多策略 MORL 中,针对冲突目标的各种偏好下的决策策略集合被优化。当训练期间目标偏好未知或应用过程中偏好动态变化时,这一点尤为重要。虽然基于线性标量化将单目标强化学习方法扩展用于 MORL 通常是直接的,但这些方法可达的解仅限于帕累托前沿的凸区域。阈值词典序(TLO)等非线性 MORL 方法旨在克服此限制。广义 MORL 方法利用函数逼近在目标偏好间进行泛化,从而以数据高效的方式隐式学习多个策略,即便对于具有高维或连续状态空间的复杂决策问题也是如此。本文提出广义阈值词典序(gTLO),一种旨在将非线性 MORL 与广义 MORL 优势相结合的新方法。我们给出了该算法的深度强化学习实现,并在非线性 MORL 标准基准和制造过程控制领域的真实应用中展示了有前景的结果。

关键词

引用

@article{arxiv.2204.04988,
  title  = {gTLO: A Generalized and Non-linear Multi-Objective Deep Reinforcement Learning Approach},
  author = {Johannes Dornheim},
  journal= {arXiv preprint arXiv:2204.04988},
  year   = {2022}
}