中文

用于更安全智能体激励的路径特定目标

人工智能 2022-04-22 v1 机器学习

摘要

我们提出一个通用框架,用于训练朴素激励不安全的智能体。例如,操纵或欺骗行为可能提高奖励但应避免。大多数方法在此失败:智能体不择手段地最大化期望回报。我们形式化描述了具有不应被当作手段使用的“脆弱”状态部分的设定。然后,我们利用因果影响图分析,训练智能体最大化动作对期望回报的、不由脆弱状态部分中介的因果效应。所得智能体没有控制脆弱状态的激励。我们进一步展示了我们的框架如何统一并推广现有提案。

关键词

引用

@article{arxiv.2204.10018,
  title  = {Path-Specific Objectives for Safer Agent Incentives},
  author = {Sebastian Farquhar and Ryan Carey and Tom Everitt},
  journal= {arXiv preprint arXiv:2204.10018},
  year   = {2022}
}

备注

Presented at AAAI 2022