中文

开放权重基因组语言模型安全:通过对抗微调评估鲁棒性

机器学习 2026-03-24 v2 人工智能

摘要

新型深度学习架构正不断应用于生物数据,包括基因序列。这些模型称为基因组语言模型(gLMs),已展现出惊人的预测与生成能力,引发担忧其可能被用于生成人类感染病毒的基因组等。这些担忧催化了风险缓解措施的呼声。数据过滤(即从训练数据集中移除病毒基因组序列)是事实上的主要缓解措施,以限制 gLM 在病毒相关任务上的性能。然而,目前尚不清楚这种做法对于可通过使用敏感致病菌数据进行微调的开源模型的安全性如何。本文评估了最先进的 gLM Evo 2,并使用来自 110 种有害人类感染病毒的序列进行微调,以评估这些能力是否被“拯救”。微调后的模型在未见的病毒序列上表现出降低的困惑度,相较于 1)预训练模型和 2)在细菌噬菌体序列上进行微调的版本。使用人类感染病毒进行微调的模型还识别了来自 SARS-CoV-2 的免疫逃逸变体(虽然在微调期间未接触 SARS-CoV-2序列),实现了 AUROC 为 0.6。本工作表明,数据排除可能被通过能够以某种程度恢复 gLM 误用相关能力的微调方法所规避。我们强调为 gLMs 所需的安全框架,并概述了进一步工作在评估和缓解措施方面,以实现 gLMs 的安全部署所需的工作。

关键词

引用

@article{arxiv.2511.19299,
  title  = {Open-weight genome language model safeguards: Assessing robustness via adversarial fine-tuning},
  author = {James R. M. Black and Moritz S. Hanke and Aaron Maiwald and Tina Hernandez-Boussard and Oliver M. Crook and Jaspreet Pannu},
  journal= {arXiv preprint arXiv:2511.19299},
  year   = {2026}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Biosecurity Safeguards for Generative AI