中文

词典序多目标强化学习

机器学习 2022-12-29 v1

摘要

在这项工作中,我们介绍了用于求解词典序多目标问题的强化学习技术。这类问题涉及多个奖励信号,其目标是学习一个策略,在最大化第一个奖励信号的前提下,受此约束再最大化第二个奖励信号,依此类推。我们提出了一系列可用于求解此类问题的动作价值与策略梯度算法,并证明它们收敛到词典序最优的策略。我们通过实验评估了这些算法的可扩展性与性能,展示了它们的实际适用性。作为一个更具体的应用,我们展示了我们的算法如何用于对智能体行为施加安全约束,并在该背景下将其性能与其他约束强化学习算法进行比较。

关键词

引用

@article{arxiv.2212.13769,
  title  = {Lexicographic Multi-Objective Reinforcement Learning},
  author = {Joar Skalse and Lewis Hammond and Charlie Griffin and Alessandro Abate},
  journal= {arXiv preprint arXiv:2212.13769},
  year   = {2022}
}