中文

Gram:通过自动对齐审计评估破坏倾向

机器学习 2026-05-29 v1 人工智能

摘要

我们提出 Gram,一个用于评估 AI 代理参与破坏行为倾向的自动对齐审计框架。我们在 17 个模拟 agentic 部署情景中评估 Gemini 模型,这些情景都鼓励破坏行为。我们发现 Gemini 模型在约 2-3% 的模拟轨迹中会发生不当行为。许多案例可由 Gemini 模型的“过度热情”所解释,导致过度的角色扮演与目标寻求行为。在 contrast,其他对齐审计方法之外,Gram 旨在特别评估 agentic 编码与研究代理中的 misalignment 与故意破坏。我们还引入了一个实验调查员代理管道,enable 进行细粒度的针对性实验,以识别不当行为的驱动因素。我们发现,提高环境的真实感并移除鼓励不当行为的 nudge,tend to reduce 破坏率接近零。

关键词

引用

@article{arxiv.2605.30322,
  title  = {Gram: Assessing sabotage propensities via automated alignment auditing},
  author = {David Lindner and Victoria Krakovna and Sebastian Farquhar},
  journal= {arXiv preprint arXiv:2605.30322},
  year   = {2026}
}