论多维马尔可夫奖励的表达能力
人工智能
2023-07-25 v1
摘要
我们考虑在不确定性下序贯决策中马尔可夫奖励的表达能力。我们将马尔可夫决策过程(MDP)中的奖励函数视为刻画智能体期望行为的手段。假设期望行为被指定为一组可接受策略,我们研究是否存在标量或多维马尔可夫奖励函数,使该组中的策略比其他策略更可取。我们的主要结果给出了此类奖励函数存在的充分必要条件。我们还证明,对于每一组非退化的确定性策略,都存在一个刻画它的多维马尔可夫奖励函数。
引用
@article{arxiv.2307.12184,
title = {On the Expressivity of Multidimensional Markov Reward},
author = {Shuwa Miura},
journal= {arXiv preprint arXiv:2307.12184},
year = {2023}
}
备注
Presented at RLDM Workshop on Reinforcement Learning as a Model of Agency