中文

基于辩论的对齐安全论证草图

人工智能 2025-05-26 v3

摘要

如果AI系统在广泛的任务上达到或超过人类能力,人类可能难以有效判断其行为——这使得利用人类反馈将其引导至期望的特性变得困难。一个提出的解决方案是利用另一个超人类系统,通过辩论指出系统输出中的缺陷。本文概述了辩论对于AI安全的价值,以及使辩论奏效所需的假设和进一步研究。它通过勾勒一个“对齐安全论证”——即一个AI系统尽管有能力采取可能导致严重伤害的行动,但不会自主采取此类行动的论证——来做到这一点。该草图聚焦于AI公司内部的AI研发智能体破坏研究的风险,例如通过产生虚假结果。为防止这种情况,该智能体通过辩论进行训练,并辅以探索保证,以教会系统保持诚实。诚实性在整个部署过程中通过在线训练得以维持。该安全论证基于四个关键主张:(1)该智能体已擅长辩论游戏,(2)在辩论游戏中的良好表现意味着系统大体上是诚实的,(3)系统在部署期间不会变得显著不诚实,以及(4)部署环境能够容忍一些错误。我们识别出了一些开放的研究问题,如果这些问题得到解决,可能会使这成为一个令人信服的论证,证明AI系统是安全的。

关键词

引用

@article{arxiv.2505.03989,
  title  = {An alignment safety case sketch based on debate},
  author = {Marie Davidsen Buhl and Jacob Pfau and Benjamin Hilton and Geoffrey Irving},
  journal= {arXiv preprint arXiv:2505.03989},
  year   = {2025}
}