ARMOR 2025:面向军事场景的大型语言模型安全评估基准
人工智能
2026-05-04 v1
摘要
大型语言模型 (LLM) 已被探索用于需要可靠且符合法律要求的决策支持的防御应用中。它们还具有显著潜力可提高军事情境下的决策、协调和操作效率。这些用例需要反映指导真实军事作业的制度标准的评估方法。现有的安全基准关注一般社会风险,未测试模型是否遵循支配真实军事作业的法律和伦理规则。为填补这一差距,我们引入 ARMOR 2025,这是一个基于三个核心军事制度——战争法、作战规则和联合伦理规范的军事对齐安全基准。我们从这些来源中提取制度文本并生成多选问题,以保留每条规则的原意。该基准通过受观察-决定-行动 (OODA) 决策框架指导的分类法进行组织。这一结构使其能够系统性地测试准确率和拒绝率 across 军事相关决策类型。该基准包含结构化的 12 类分类、519 个制度导向的提示以及对 21 个商业 LLM 实施的严格评估程序。评估结果揭示了军事应用场景下安全对齐的关键缺口。
引用
@article{arxiv.2605.00245,
title = {ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts},
author = {Sydney Johns and Heng Jin and Chaoyu Zhang and Y. Thomas Hou and Wenjing Lou},
journal= {arXiv preprint arXiv:2605.00245},
year = {2026}
}