中文

基础模型可能在新型 CBRN 威胁披露中呈现阶段性发展

计算机与社会 2025-03-20 v1 人工智能 其他定量生物学

摘要

由于缺乏测试案例,基础模型能否向专家用户披露新型化学、生物、辐射和核 (CBRN) 威胁的程度尚不清楚。我利用了近期将公开的关于新型灾难性生物威胁——《镜像细菌:可行性与风险技术报告》——发布这一独特机会,在其公开前进行了小规模受控研究。被要求预测释放镜像大肠杆菌后果的研究生背景生物学家,使用 Claude Sonnet 3.5 新版本 (n=10) 或仅限网页搜索 (n=2) 进行评分,两组得分分别为 28 和 43 分,均与网页基准 (36 分) 相当。然而,Sonnet 在获报告作者提示下能正确推理,而规模更小的 Haiku 3.5 即便获作者指导也未能正确推理 (80 分 vs 5 分)。这些结果表明模型能力呈现 distinct 阶段:Haiku 无法即使在威胁意识到的专家指导下推理镜像生命 (阶段 1),而 Sonnet 仅在威胁意识到的提示下才能正确推理 (阶段 2)。持续的进步可能使未来模型能够向不熟悉的专家 (阶段 3) 或不熟练的用户 (阶段 4) 披露新型 CBRN 威胁。虽然镜像生命仅代表一种案例研究,但监控新模型对私下已知威胁的推理能力,可能在广泛披露前实施保护措施。

关键词

引用

@article{arxiv.2503.15182,
  title  = {Foundation models may exhibit staged progression in novel CBRN threat disclosure},
  author = {Kevin M Esvelt},
  journal= {arXiv preprint arXiv:2503.15182},
  year   = {2025}
}

备注

26 pages, 2 figures