中文

强化学习智能体的幸福定义

人工智能 2015-05-19 v1

摘要

强化学习智能体的幸福是什么?我们寻求一个满足一系列期望性质的形式化定义。我们提出的幸福定义是时序差分误差,即获得的奖励与观测的价值与该智能体对此价值的期望之间的差异。该定义满足我们大多数期望性质,并且与关于人类的实证研究相容。我们陈述了若干推论并讨论了示例。

关键词

引用

@article{arxiv.1505.04497,
  title  = {A Definition of Happiness for Reinforcement Learning Agents},
  author = {Mayank Daswani and Jan Leike},
  journal= {arXiv preprint arXiv:1505.04497},
  year   = {2015}
}

备注

AGI 2015