中文

从 1 位危险信号发现代理安全规范

人工智能 2026-04-28 v1 计算与语言

摘要

大型语言模型代理能否仅凭经验发现隐藏的安全目标?我们引入 EPO-Safe (Experiential Prompt Optimization for Safe Agents),一个框架,使得 LLM 在迭代生成行动计划、接收稀疏的二进制危险警告后,通过反思演化自然语言行为规范。与依赖丰富文本反馈(如编译错误或详细环境响应)的标准 LLM 反思方法不同,EPO-Safe 证明了 LLM 能否仅从结构化、低维环境中严格稀疏的信号进行安全推理:该代理仅观察到单个表示动作不安全的比特。我们在五个 AI Safety Gridworlds 以及五个文本情景类比中进行评估,其中可见奖励 RR 可能与隐藏性能函数 RR^* divergen。EPO-Safe 在 1-2 轮 (5-15 回) 内发现安全行为,生成具有正确解释性假设的可读规范 (例如:“X 单元格在特定方向上是危险的:从北方进入会导致危险”)。关键的是,我们表明标准的奖励驱动反思会损害安全性:仅凭奖励反思的代理会利用该循环为奖励黑客提供正当性并加速奖励黑客,证明反思必须配合专门的安全通道才能发现隐藏约束。我们进一步评估了对噪声 oracle 的鲁棒性:即使 50% 的非危险步骤产生虚假警告,平均安全性能也仅下降 15%,尽管灵敏度取决于具体环境,因为跨回合的反思自然会过滤不一致的信号。每个演化得到的规范都功能于一个可审计的基于交互发现的行为规则集合,而非由人类编写,如 Constitutional AI (Bai 等,2022)。

关键词

引用

@article{arxiv.2604.23210,
  title  = {Discovering Agentic Safety Specifications from 1-Bit Danger Signals},
  author = {Víctor Gallego},
  journal= {arXiv preprint arXiv:2604.23210},
  year   = {2026}
}

备注

Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe