面向国家安全的尖端人工智能系统可靠性保障
计算机与社会
2025-10-13 v1
摘要
本备忘录提出了四项建议,旨在加强 AI 模型可靠性和 AI 模型可治理性的原则。随着 DoW、ODNI、NIST 和 CAISI 在 AI 行动计划下完善 AI 保障框架,我们的工作聚焦于错位(misalignment)这一开放科学问题及其对 AI 模型行为的影响。具体而言,错位和欺骗能力可能是 AI 模型可靠性和可治理性不足的警示信号。为应对错位带来的国家安全威胁,我们建议 DoW 和情报界(IC)战略性地利用现有的测试与评估流水线及其 OT 权限,通过一系列欺骗与控制评估来前瞻性地保障 AI 模型可靠性和可治理性的原则。
引用
@article{arxiv.2510.08792,
title = {Assurance of Frontier AI Built for National Security},
author = {Matteo Pistillo and Charlotte Stix},
journal= {arXiv preprint arXiv:2510.08792},
year = {2025}
}