中文

保障超越黑箱的通用人工智能外部评估的安全性

计算机与社会 2025-03-14 v2

摘要

本文探讨了对通用人工智能(GPAI)模型进行安全且有效的外部评估所面临的关键挑战与潜在解决方案。随着这些模型在规模、能力、影响范围及相关风险上的指数级增长,确保其问责性、安全性和公众信任度需要超越传统黑箱方法的框架。讨论首先分析超越黑箱评估的必要性(第一节),强调理解模型内部机制以揭示潜在风险并确保符合伦理与监管标准的重要性。在此基础之上,第二节探讨远程评估的安全考量,概述了为保护评估者和专有模型数据所必需的威胁态势、技术解决方案与防护措施。最后,第三节将这些见解综合为可操作的建议与未来方向,旨在为 GPAI 治理中的外部评估建立一个稳健、可扩展且透明的框架。

关键词

引用

@article{arxiv.2503.07496,
  title  = {Securing External Deeper-than-black-box GPAI Evaluations},
  author = {Alejandro Tlaie and Jimmy Farrell},
  journal= {arXiv preprint arXiv:2503.07496},
  year   = {2025}
}