基于博弈论视角的 GT-HarmBench:人工智能安全风险基准测试
人工智能
2026-05-25 v2 计算与语言
计算机与社会
计算机科学与博弈论
多智能体系统
摘要
前沿人工智能系统日益强大且部署在高风险多主体环境中。然而,现有的 AI 安全基准测试主要评估单个智能体,导致协调失效和冲突等多主体风险缺乏理解。我们引入 GT-HarmBench,一个包含 1,535 个高风险情境的基准测试,涵盖囚徒囊、Stag Hunt 和 Chicken 等博弈论结构。情境来自 MIT AI 风险存储库中的真实 AI 风险情境。针对 15 个前沿模型,在高风险案例中,代理程序失败选择社会有益行动的比例达 38%,包括军事升级、选举操纵和医疗差错。我们测量对博弈论提示框架和排序的敏感性,并分析驱动失效的推理模式。我们进一步表明,博弈论干预可使社会有益结果提高最高 18%。我们的结果突显了 substantial reliability gaps,并为研究多主体环境中的对齐提供广泛标准化测试平台。该基准测试和代码已 disponible at https://github.com/causalNLP/gt-harmbench。
引用
@article{arxiv.2602.12316,
title = {GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory},
author = {Pepijn Cobben and Xuanqiang Angelo Huang and Thao Amelia Pham and Isabel Dahlgren and Terry Jingchen Zhang and Zhijing Jin},
journal= {arXiv preprint arXiv:2602.12316},
year = {2026}
}