中文

期望标量化回报占优:多目标决策的新解概念

机器学习 2022-07-06 v3 人工智能

摘要

在许多真实场景中,用户的效用来源于对策略的单一执行。在此情形下,要应用多目标强化学习,必须优化回报的期望效用。存在多种场景,其中用户对各目标的偏好(亦称效用函数)未知或难以指定。此类场景中,必须学习一组最优策略。然而,期望效用须被最大化的设定在很大程度上被多目标强化学习界所忽视,因此一组最优解尚待定义。本文中,我们通过提出以一阶随机占优作为构建解集合以最大化期望效用的准则来应对这一挑战。我们还提出一种称为期望标量化回报(ESR)占优的新占优准则,将一阶随机占优扩展以允许在实践中学习一组最优策略。我们随后定义称为 ESR 集合的新解概念,即一组 ESR 占优的策略。最后,我们定义一种新的多目标分布表格强化学习(MOT-DRL)算法,以在多目标多臂老虎机设定中学习 ESR 集合。

关键词

引用

@article{arxiv.2106.01048,
  title  = {Expected Scalarised Returns Dominance: A New Solution Concept for Multi-Objective Decision Making},
  author = {Conor F. Hayes and Timothy Verstraeten and Diederik M. Roijers and Enda Howley and Patrick Mannion},
  journal= {arXiv preprint arXiv:2106.01048},
  year   = {2022}
}