中文

安全精调能否更原则化?来自网络安全的经验教训

密码学与安全 2025-01-22 v1 人工智能 机器学习

摘要

随着大语言模型能力的不断提升,降低其输出可能对社会造成的伤害的迫切需求日益增长,因此大多数大语言模型都会添加安全防护措施,例如通过精调实现。本文提出,当前的安全精调与网络安全中防御者与攻击者之间的传统“猫鼠游戏”(或军备竞赛)非常相似。模型越狱和攻击通过针对特定攻击机制的便当进行补救,但可能仍存在许多类似的攻击向量。当防御者没有主动提出原则化机制时,攻击者很容易绕过任何新的防御措施。我们展示了当前的防御措施不足以防止新的对抗性越狱攻击、奖励作弊以及控制丧失问题。为了从网络安全中的过去错误中学习,我们借鉴历史案例,提出可应用于大语言模型安全的经验教训。这些论点支持需要新的更原则化的安全模型设计方法,这些方法从一开始就针对安全性进行设计。我们描述了来自人工智能文献中的几种此类方法。

关键词

引用

@article{arxiv.2501.11183,
  title  = {Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity},
  author = {David Williams-King and Linh Le and Adam Oberman and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2501.11183},
  year   = {2025}
}

备注

published at Neurips Safe Generative AI Workshop 2024