中文

人类非理性:对奖励推断的坏处与好处

机器学习 2021-11-16 v1

摘要

假设人类(近似)理性使机器人能够通过观察人类行为推断奖励函数。但人们表现出各种各样的非理性,我们这项工作旨在更好地理解它们对奖励推断可能产生的影响。研究该影响的挑战在于存在许多类型的非理性,其数学形式化程度各不相同。因此,我们通过修改贝尔曼最优方程,在MDP(马尔可夫决策过程)的语言中对非理性进行操作化,并利用该框架研究这些修改将如何影响推断。我们发现,将系统性非理性的人类错误地建模为噪声理性,比正确捕捉这些偏差的表现差得多——以至于干脆跳过推断、坚持先验反而更好!更重要的是,我们表明,当被正确建模时,非理性人类能够比完全理性的人类传达更多关于奖励的信息。也就是说,如果机器人拥有对人类非理性的正确模型,它就能做出比人类理性时更强的推断。非理性从根本上有助于而非阻碍奖励推断,但需要被正确考量。

关键词

引用

@article{arxiv.2111.06956,
  title  = {Human irrationality: both bad and good for reward inference},
  author = {Lawrence Chan and Andrew Critch and Anca Dragan},
  journal= {arXiv preprint arXiv:2111.06956},
  year   = {2021}
}

备注

12 pages, 10 figures