蒙特卡罗预期威胁(MOCET)评分
机器学习
2025-11-24 v1 人工智能
人机交互
摘要
评估和衡量AI安全等级(ASL)威胁对于指导利益相关者实施措施至关重要,以确保风险保持在可接受的范围内。ASL-3+ 模型在提升新手非国家行为者方面 presents 一种独特的风险,尤其是在生物安全领域。现有的评估指标,如 LAB-Bench、BioLP-bench 和 WMDP,能够可靠地评估模型提升和领域知识。然而,为 LLMs 提供更贴近“现实世界风险”的指标,以及与其快速发展相适应的可扩展、开放性指标,仍有不足。为此,我们引入了 MOCET,这是一个可解释且双重可扩展的指标(可自动化和开放性),可量化现实世界风险。
引用
@article{arxiv.2511.16823,
title = {Monte Carlo Expected Threat (MOCET) Scoring},
author = {Joseph Kim and Saahith Potluri},
journal= {arXiv preprint arXiv:2511.16823},
year = {2025}
}
备注
Accepted to NeurIPS 2025 BioSafe GenAI