中文

蒙特卡罗预期威胁(MOCET)评分

机器学习 2025-11-24 v1 人工智能 人机交互

摘要

评估和衡量AI安全等级(ASL)威胁对于指导利益相关者实施措施至关重要,以确保风险保持在可接受的范围内。ASL-3+ 模型在提升新手非国家行为者方面 presents 一种独特的风险,尤其是在生物安全领域。现有的评估指标,如 LAB-Bench、BioLP-bench 和 WMDP,能够可靠地评估模型提升和领域知识。然而,为 LLMs 提供更贴近“现实世界风险”的指标,以及与其快速发展相适应的可扩展、开放性指标,仍有不足。为此,我们引入了 MOCET,这是一个可解释且双重可扩展的指标(可自动化和开放性),可量化现实世界风险。

关键词

引用

@article{arxiv.2511.16823,
  title  = {Monte Carlo Expected Threat (MOCET) Scoring},
  author = {Joseph Kim and Saahith Potluri},
  journal= {arXiv preprint arXiv:2511.16823},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025 BioSafe GenAI