中文

保障有用性病原体数据

人工智能 2026-02-10 v1 其他定量生物学

摘要

训练数据是创建专业人工智能(AI)模型的 essential 输入。用于生物学的 AI 模型是在大量数据上训练的,包括与生物序列、结构、图像和功能相关的数据。用于训练模型的数据类型与其最终所具备的能力紧密相关——包括具有生物安全 concerns 的能力。因此,超过 100 名研究者在最近的 50 周年纪念阿西莫尔会议上批准了数据控制措施,以防止 AI 被用于有害应用,如生物武器开发。为帮助设计此类控制措施,我们引入了一个五层 Biosecurity Data Level(BDL)框架,用于对病原体数据进行分类。每个层级包含特定的数据类型,基于其在训练 AI 模型时 contributing to capabilities of concern 的预期能力。对于每个 BDL 层级,我们提出了适当的技术限制。最后,我们概述了一个用于新创建的双用途病原体数据的 novel governance 框架。在计算和编码资源广泛可及的世界中,数据控制可能是减少具有担忧生物学 AI 能力传播的最高杠杆干预措施。

关键词

引用

@article{arxiv.2602.08061,
  title  = {Securing Dual-Use Pathogen Data of Concern},
  author = {Doni Bloomfield and Allison Berke and Moritz S. Hanke and Aaron Maiwald and James R. M. Black and Toby Webster and Tina Hernandez-Boussard and Oliver M. Crook and Jassi Pannu},
  journal= {arXiv preprint arXiv:2602.08061},
  year   = {2026}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Biosecurity Safeguards for Generative AI