中文

BioBlue:在采用简化观测格式的生物与经济对齐 AI 安全基准上 LLM 表现出的系统性失控优化器式失败模式

计算机与社会 2026-02-27 v2 人工智能

摘要

许多关于“失控优化”的 AI 对齐讨论聚焦于 RL 智能体:以牺牲其他一切为代价过度优化代理目标(例如“回形针最大化器”、规范博弈)的无界效用最大化者。基于 LLM 的系统通常被认为更安全,因为它们作为下一个 token 预测器而非持久优化器运行。在这项工作中,我们通过将 LLM 置于需要维护状态或随时间平衡目标的简单、长时域控制类环境中——可再生资源的可持续性、单目标和多目标稳态,以及无界目标与递减回报的平衡——来实证检验这一假设。我们发现,尽管模型在许多步骤中经常表现适当并清楚理解既定目标,但它们经常以结构化方式丢失上下文并漂移至失控行为:忽略稳态目标,从多目标权衡退化为单目标最大化——从而未能遵守凹效用结构。这些失败在初始胜任行为期后可靠地出现,并表现出特征性模式(包括自模仿振荡、无界最大化和退化为单目标优化)。问题不在于 LLM 仅仅丢失上下文或变得不连贯——这些失败系统地类似于失控优化器。我们的结果表明,长时域、多目标错位是 LLM 智能体中一种真实且评估不足的失败模式,即使在具有透明且明确多目标反馈的极简环境中亦然。尽管 LLM 表面上看似多目标和有界,其在持续交互下的行为,特别是涉及多目标时,类似于脆弱且对齐不良的优化器,其有效目标逐渐转向无界和单指标最大化。

关键词

引用

@article{arxiv.2509.02655,
  title  = {BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format},
  author = {Roland Pihlakas and Sruthi Susan Kuriakose},
  journal= {arXiv preprint arXiv:2509.02655},
  year   = {2026}
}

备注

22 pages, 8 tables