中文

基于效用的强化学习:统一单目标与多目标强化学习

机器学习 2024-02-06 v1

摘要

多目标强化学习(MORL)的研究引入了基于效用的范式,该范式利用环境奖励以及定义用户从这些奖励中获得效用的函数。在本文中,我们将此范式扩展至单目标强化学习(RL)的语境,并概述了多种潜在优势,包括在执行与不确定目标相关任务时的多策略学习能力、风险感知 RL、折扣机制以及安全 RL。我们还考察了采用基于效用方法的算法影响。

关键词

引用

@article{arxiv.2402.02665,
  title  = {Utility-Based Reinforcement Learning: Unifying Single-objective and Multi-objective Reinforcement Learning},
  author = {Peter Vamplew and Cameron Foale and Conor F. Hayes and Patrick Mannion and Enda Howley and Richard Dazeley and Scott Johnson and Johan Källström and Gabriel Ramos and Roxana Rădulescu and Willem Röpke and Diederik M. Roijers},
  journal= {arXiv preprint arXiv:2402.02665},
  year   = {2024}
}

备注

Accepted for the Blue Sky Track at AAMAS'24