中文

奖励推进:在最大因果熵原理下转换策略

人工智能 2019-07-12 v1

摘要

许多真实世界的人类行为可表征为序贯决策过程,例如城市出行者对交通方式与路径的选择(Wu 等 2017)。与通常由机器控制的选择不同(后者一般遵循完全理性以采用具有最高奖励的策略),研究已揭示人类智能体在有限理性下做出次优决策(Tao, Rohde, and Corcoran 2014)。此类行为可使用最大因果熵(MCE)原理建模(Ziebart 2010)。本文中,我们定义并研究一个通用的奖励转换问题(即奖励推进):在 MCE 原理下,恢复将智能体策略从原始策略转换为预定义目标策略的附加奖励函数的范围。我们表明,给定一个 MDP 与一个目标策略,存在无穷多个可实现所需策略转换的附加奖励函数。此外,我们提出一种算法,以进一步提取实现该策略转换且具有最小“代价”的附加奖励。

关键词

引用

@article{arxiv.1907.05390,
  title  = {Reward Advancement: Transforming Policy under Maximum Causal Entropy Principle},
  author = {Guojun Wu and Yanhua Li and Zhenming Liu and Jie Bao and Yu Zheng and Jieping Ye and Jun Luo},
  journal= {arXiv preprint arXiv:1907.05390},
  year   = {2019}
}