中文

量化人工代理中非权力寻求行为的稳定性

人工智能 2024-01-09 v1

摘要

我们研究这样一个问题:如果一个 AI 代理在某种环境中已知是安全的,那么在另一个与前者相似的新环境中它是否也是安全的?这是 AI 对齐的核心问题——我们在特定环境中训练和测试模型,但将其部署在另一环境中,我们需要保证在测试中看似安全的模型在部署中依然安全。我们的安全概念基于权力寻求——寻求权力的代理是不安全的。特别地,我们关注一种关键的权力寻求类型:抵抗关机。我们将代理建模为马尔可夫决策过程 (MDP) 的策略,并表明(在两种感兴趣的情况下)不抵抗关机是“稳定”的:如果一个 MDP 具有某些不避免关机的策略,那么相似 MDP 的对应策略也不避免关机。我们还表明存在安全_不_稳定的自然情况——任意小的扰动可能导致永不关机的策略。在我们第一种感兴趣的情况(近最优策略)中,我们利用 MDP 上的双模拟度量证明小扰动不会使代理花费更长时间才关机。第二种感兴趣的情况是满足某些约束(适用于包括语言模型在内的各种模型)的 MDP 策略。在此,我们展示了不关机概率增加速度的定量界限:通过定义 MDP 上的度量;证明不关机概率作为 MDP 的函数是下半连续的;并限定该函数下降的速度。

关键词

引用

@article{arxiv.2401.03529,
  title  = {Quantifying stability of non-power-seeking in artificial agents},
  author = {Evan Ryan Gunter and Yevgeny Liokumovich and Victoria Krakovna},
  journal= {arXiv preprint arXiv:2401.03529},
  year   = {2024}
}

备注

37 pages, 5 figures