Deep Ignorance:通过过滤预训练数据为开源大模型构建防篡改安全措施
机器学习
2026-02-18 v2 人工智能
摘要
开源模型具有透明性、开放研究和去中心化访问等独特优势,但易受到篡改攻击,这类攻击可通过修改权重或激活值来高效诱发有害行为。目前尚不存在成熟的开源模型风险管理科学。现有的安全微调方法和其他后训练技术在抵御数十步对抗微调攻击方面效果不佳。本文我们探讨了从训练数据中过滤涉及双用途主题的文本是否可以防止不必要的能力并作为更具抗篡改性的安全措施。我们引入了用于可扩展数据过滤的多阶段管道,证明其具备可行且有效的方法,可最小化生物威胁类比知识在大模型中的存在。我们从头预训练了多个6.9B参数的模型,发现它们在针对最高10,000步和3000万生物威胁相关文本的对抗微调攻击下表现出显著抗性——显著优于现有后训练基线(优势超过一个数量级),且未观察到对无关能力的退化。然而,尽管过滤后的模型缺乏内化的危险知识,但我们发现当该信息被提供到上下文中(例如通过搜索工具增强)时,模型仍可利用此类信息,这表明需要采取防御深层次的措施。总体而言,这些发现有助于确立预训练数据筛选作为开源AI系统防御层的前景。
引用
@article{arxiv.2508.06601,
title = {Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs},
author = {Kyle O'Brien and Stephen Casper and Quentin Anthony and Tomek Korbak and Robert Kirk and Xander Davies and Ishan Mishra and Geoffrey Irving and Yarin Gal and Stella Biderman},
journal= {arXiv preprint arXiv:2508.06601},
year = {2026}
}
备注
https://deepignorance.ai/