中文

在复杂环境中避免副作用

人工智能 2020-10-23 v2

摘要

奖励函数设定可能很困难。奖励智能体制造一个小部件或许容易,但惩罚大量可能的负面副作用则很困难。在玩具环境中,可达效用保持(AUP)通过惩罚实现随机生成目标的能力偏移来避免副作用。我们将该方法扩展到基于康威生命游戏的大型随机生成环境。通过保持单一随机生成奖励函数的最优值,AUP 产生适度开销,同时引导智能体完成指定任务并避免许多副作用。视频和代码可在 https://avoiding-side-effects.github.io/ 获取。

关键词

引用

@article{arxiv.2006.06547,
  title  = {Avoiding Side Effects in Complex Environments},
  author = {Alexander Matt Turner and Neale Ratzlaff and Prasad Tadepalli},
  journal= {arXiv preprint arXiv:2006.06547},
  year   = {2020}
}

备注

Accepted as spotlight paper at NeurIPS 2020. 10 pages main paper; 19 pages with appendices