在复杂环境中避免副作用
人工智能
2020-10-23 v2
摘要
奖励函数设定可能很困难。奖励智能体制造一个小部件或许容易,但惩罚大量可能的负面副作用则很困难。在玩具环境中,可达效用保持(AUP)通过惩罚实现随机生成目标的能力偏移来避免副作用。我们将该方法扩展到基于康威生命游戏的大型随机生成环境。通过保持单一随机生成奖励函数的最优值,AUP 产生适度开销,同时引导智能体完成指定任务并避免许多副作用。视频和代码可在 https://avoiding-side-effects.github.io/ 获取。
引用
@article{arxiv.2006.06547,
title = {Avoiding Side Effects in Complex Environments},
author = {Alexander Matt Turner and Neale Ratzlaff and Prasad Tadepalli},
journal= {arXiv preprint arXiv:2006.06547},
year = {2020}
}
备注
Accepted as spotlight paper at NeurIPS 2020. 10 pages main paper; 19 pages with appendices