中文

利用众包诱导评估AI网络能力

密码学与安全 2025-05-28 v2 人工智能

摘要

随着AI系统日益强大,理解其攻击性网络潜力对于明智的治理和负责任的部署至关重要。然而,很难准确界定其能力边界,且先前的一些评估极大地低估了它们。从AI中提取最大任务特定性能的艺术被称为“AI诱导”,当今的安全组织通常在内部进行这项工作。在本文中,我们探索将众包诱导工作作为内部诱导工作的替代方案。我们在两场夺旗赛(CTF)竞赛中举办了开放获取的AI赛道:AI vs. Humans(400支队伍)和Cyber Apocalypse(8000支队伍)。AI团队在两场赛事中均取得了出色的表现,分别排名前5%和前10%,共获得7500美元的奖金。这一令人瞩目的表现表明,开放式市场诱导可以有效补充内部诱导。我们提出将诱导奖金作为一种实用机制,以维持对新兴AI能力的及时、高性价比的态势感知。开放式诱导的另一个优势是能够大规模收集人类表现数据。应用METR的方法论,我们发现AI智能体能够可靠地解决中等水平人类CTF参与者需要一小时或更少努力即可完成的网络挑战。

关键词

引用

@article{arxiv.2505.19915,
  title  = {Evaluating AI cyber capabilities with crowdsourced elicitation},
  author = {Artem Petrov and Dmitrii Volkov},
  journal= {arXiv preprint arXiv:2505.19915},
  year   = {2025}
}

备注

Updated abstract to fix a typo; no changes to the content of the paper