可验证的 AI 安全基准:基于受信任执行环境的可审计性
计算机视觉与模式识别
2025-07-01 v1
摘要
基准测试是评估 AI 模型大规模安全性和合规性的重要手段。然而,这些基准测试通常不提供可验证的结果,也缺乏对模型知识产权和基准数据集的保密性。我们提出了可审计的方案 (Attestable Audits),其在受信任执行环境中运行,使用户能够验证与合规 AI 模型的交互。我们的工作即使在模型提供方与审计方互不信任的情况下,也能保护敏感数据。这解决了近期 AI 治理框架所提出的验证挑战。我们构建了一个在典型审计基准测试中针对 Llama-3.1 的原型系统,演示了其可行性。
引用
@article{arxiv.2506.23705,
title = {Single Image Test-Time Adaptation via Multi-View Co-Training},
author = {Smriti Joshi and Richard Osuala and Lidia Garrucho and Kaisar Kushibar and Dimitri Kessler and Oliver Diaz and Karim Lekadir},
journal= {arXiv preprint arXiv:2506.23705},
year = {2025}
}
备注
MICCAI 2025