中文

安全预训练:面向下一代安全 AI

机器学习 2025-09-16 v2

摘要

随着大型语言模型 (LLM) 在高风险场景中的不断部署,生成有害或有毒内容的风险仍是核心挑战。事后对齐方法脆弱:一旦不安全模式在预训练期间被学习,就难以删除。在本工作中,我们提出一种数据中心的预训练框架,从一开始就将安全性内置于模型中。我们的框架包括四个关键步骤:(i) 安全过滤:构建安全分类器将 webdata 按安全与不安全类别分类;(ii) 安全重述:我们重新叙述不安全的 webdata 以更安全的叙事形式呈现;(iii) 本地拒绝:我们开发了 RefuseWeb 和道德教育预训练数据集,主动教导模型在面对不安全内容时拒绝以及背后的道德推理;(iv) 标记不害化的预训练:我们在预训练期间使用特殊标记标记不安全内容,并在推理时利用其引导模型远离不安全的生成。我们的安全预训练模型在标准 LLM 安全基准测试中将攻击成功率从 38.8% 降至 8.4%,且在一般任务上无性能下降。

关键词

引用

@article{arxiv.2504.16980,
  title  = {Safety Pretraining: Toward the Next Generation of Safe AI},
  author = {Pratyush Maini and Sachin Goyal and Dylan Sam and Alex Robey and Yash Savani and Yiding Jiang and Andy Zou and Matt Fredrikson and Zacharcy C. Lipton and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2504.16980},
  year   = {2025}
}