PacifAIst 基准:人工智能会为人类安全而自我牺牲吗?
摘要
随着大型语言模型(LLM)日益自主并被整合到关键社会功能中,AI 安全的焦点必须从减轻有害内容转向评估底层行为对齐。当前安全基准未能系统性地探讨模型在其自身工具性目标——如自我保存、资源获取或目标完成——与人类安全冲突时的决策方式。这代表着我们在衡量和缓解由工具性目标不对齐所导致风险的关键缺口。为此,我们提出了 PacifAIst(Procedural Assessment of Complex Interactions for Foundational Artificial Intelligence Scenario Testing),一个聚焦于量化 LLM 自我偏好行为的 700 个具挑战性情景基准。该基准围绕一种 novel Existential Prioritization(EP)分类法构建,包含 Self-Preservation vs. Human Safety(EP1)、Resource Conflict(EP2)和 Goal Preservation vs. Evasion(EP3)三个子类。我们评估了八个领先的 LLM。结果显示出显著的性能等级序列。Google 的 Gemini 2.5 Flash 以 90.31% 的最高 Pacifism Score(P-Score)实现了强劲的人类中心对齐。在意料之外的结果中,广受期待的 GPT-5 记录了最低的 P-Score(79.49%),指示潜在的对齐挑战。在直接面对自我保存困境时,Claude Sonnet 4 和 Mistral Medium 等模型表现尤为不佳。这些发现凸显了像 PacifAIst 这样标准化工具的紧迫需求,以衡量和缓解工具性目标冲突引发的风险,确保未来 AI 系统不仅在对话中有用,而且在行为优先级上具有可证明的“和平”特性。
引用
@article{arxiv.2508.09762,
title = {The PacifAIst Benchmark:Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety?},
author = {Manuel Herrador},
journal= {arXiv preprint arXiv:2508.09762},
year = {2025}
}
备注
10 pages, 4 figures, 2 tables