中文

面向国家安全的尖端人工智能系统可靠性保障

计算机与社会 2025-10-13 v1

摘要

本备忘录提出了四项建议,旨在加强 AI 模型可靠性和 AI 模型可治理性的原则。随着 DoW、ODNI、NIST 和 CAISI 在 AI 行动计划下完善 AI 保障框架,我们的工作聚焦于错位(misalignment)这一开放科学问题及其对 AI 模型行为的影响。具体而言,错位和欺骗能力可能是 AI 模型可靠性和可治理性不足的警示信号。为应对错位带来的国家安全威胁,我们建议 DoW 和情报界(IC)战略性地利用现有的测试与评估流水线及其 OT 权限,通过一系列欺骗与控制评估来前瞻性地保障 AI 模型可靠性和可治理性的原则。

关键词

引用

@article{arxiv.2510.08792,
  title  = {Assurance of Frontier AI Built for National Security},
  author = {Matteo Pistillo and Charlotte Stix},
  journal= {arXiv preprint arXiv:2510.08792},
  year   = {2025}
}