中文

论马尔可夫奖励在表达多目标、风险敏感及模态任务方面的局限性

人工智能 2024-01-29 v1 机器学习

摘要

在本文中,我们研究了强化学习(RL)中标量马尔可夫奖励函数的表达能力,并指出了其所能表达内容的若干局限性。具体来说,我们考察了三类RL任务:多目标RL、风险敏感RL和模态RL。对于每一类,我们推导了描述该类问题何时可以用标量马尔可夫奖励表达的必要和充分条件。此外,我们发现标量马尔可夫奖励无法表达这三类中每一类的大多数实例。因此,我们为更全面地理解标准奖励函数能表达什么和不能表达什么做出了贡献。除此之外,我们还提请注意模态问题这一新问题类别,因为迄今为止,RL文献中尚未对它们进行任何系统性的处理。我们还简要概述了通过定制RL算法来解决我们所讨论的一些问题的方法。

关键词

引用

@article{arxiv.2401.14811,
  title  = {On the Limitations of Markovian Rewards to Express Multi-Objective, Risk-Sensitive, and Modal Tasks},
  author = {Joar Skalse and Alessandro Abate},
  journal= {arXiv preprint arXiv:2401.14811},
  year   = {2024}
}