中文

通过解耦审批避免深度强化学习中的篡改激励

机器学习 2020-11-18 v1 人工智能

摘要

当所有反馈机制都可被智能体影响时,我们如何设计追求给定目标的智能体?标准 RL 算法假设存在安全的奖励函数,因此在智能体可篡改奖励生成机制的设置中表现不佳。我们提出一个从可受影响反馈中学习的原理性解决方案,它将审批与解耦的反馈收集过程相结合。对于一类自然的损坏函数,解耦审批算法在收敛时及其局部更新上都具有对齐的激励。实证上,它们也能扩展到可能发生篡改的复杂 3D 环境。

关键词

引用

@article{arxiv.2011.08827,
  title  = {Avoiding Tampering Incentives in Deep RL via Decoupled Approval},
  author = {Jonathan Uesato and Ramana Kumar and Victoria Krakovna and Tom Everitt and Richard Ngo and Shane Legg},
  journal= {arXiv preprint arXiv:2011.08827},
  year   = {2020}
}