中文

论多维马尔可夫奖励的表达能力

人工智能 2023-07-25 v1

摘要

我们考虑在不确定性下序贯决策中马尔可夫奖励的表达能力。我们将马尔可夫决策过程(MDP)中的奖励函数视为刻画智能体期望行为的手段。假设期望行为被指定为一组可接受策略,我们研究是否存在标量或多维马尔可夫奖励函数,使该组中的策略比其他策略更可取。我们的主要结果给出了此类奖励函数存在的充分必要条件。我们还证明,对于每一组非退化的确定性策略,都存在一个刻画它的多维马尔可夫奖励函数。

关键词

引用

@article{arxiv.2307.12184,
  title  = {On the Expressivity of Multidimensional Markov Reward},
  author = {Shuwa Miura},
  journal= {arXiv preprint arXiv:2307.12184},
  year   = {2023}
}

备注

Presented at RLDM Workshop on Reinforcement Learning as a Model of Agency