中文

使用影响正则化器避免负面副作用所面临的挑战

机器学习 2021-02-24 v2 人工智能

摘要

为强化学习设计奖励函数是困难的:除了指定任务中受奖励的行为外,奖励还必须抑制不期望的结果。错误指定的奖励函数可能导致非预期的负面副作用以及整体不安全的行为。为克服该问题,近期工作提出用影响正则化器(augment)所指定的奖励函数,以抑制对环境有巨大影响的行为。尽管影响正则化器的初步结果在缓解某些类型的副作用方面似乎有前景,但重要挑战依然存在。本文中,我们审视影响正则化器的主要当前挑战,并将其与基本设计决策相关联。我们详细讨论近期方法解决了哪些挑战以及哪些仍未被解决。最后,我们探索借助影响正则化器预防负面副作用方面克服未解挑战的有前景方向。

关键词

引用

@article{arxiv.2101.12509,
  title  = {Challenges for Using Impact Regularizers to Avoid Negative Side Effects},
  author = {David Lindner and Kyle Matoba and Alexander Meulemans},
  journal= {arXiv preprint arXiv:2101.12509},
  year   = {2021}
}

备注

Presented at the SafeAI workshop at AAAI 2021