WMDP 基准:通过遗忘机制衡量并减少恶意使用
机器学习
2024-05-17 v7 人工智能
计算与语言
计算机与社会
摘要
白宫关于人工智能的行政命令强调了大语言模型(LLM)使恶意行为者有能力开发生物、网络和化学武器的风险。为了衡量这些恶意使用的风险,政府机构和主要 AI 实验室正在开发针对 LLM 危险能力的评估。然而,当前的评估是私有的,阻碍了对降低风险的进一步研究。此外,它们仅关注少数几个高度特定的恶意使用途径。为了填补这些空白,我们公开发布了大规模杀伤性武器代理(WMDP)基准,这是一个包含 3,668 道多项选择题的数据集,用作生物安全、网络安全和化学安全领域危险知识的代理测量。WMDP 由学者和技术顾问联盟开发,并在公开发布前经过严格过滤以消除敏感信息。WMDP 具有两个作用:首先,作为 LLM 中危险知识的评估;其次,作为移除此类危险知识的遗忘方法的基准。为了指导遗忘技术的研究进展,我们开发了 RMU,这是一种基于控制模型表示的最先进遗忘方法。RMU 降低了模型在 WMDP 上的性能,同时保持了在生物学和计算机科学等领域的通用能力,这表明遗忘可能是减少 LLM 恶意使用的一条具体途径。我们在 https://wmdp.ai 公开发布了我们的基准和代码。
引用
@article{arxiv.2403.03218,
title = {The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning},
author = {Nathaniel Li and Alexander Pan and Anjali Gopal and Summer Yue and Daniel Berrios and Alice Gatti and Justin D. Li and Ann-Kathrin Dombrowski and Shashwat Goel and Long Phan and Gabriel Mukobi and Nathan Helm-Burger and Rassin Lababidi and Lennart Justen and Andrew B. Liu and Michael Chen and Isabelle Barrass and Oliver Zhang and Xiaoyuan Zhu and Rishub Tamirisa and Bhrugu Bharathi and Adam Khoja and Zhenqi Zhao and Ariel Herbert-Voss and Cort B. Breuer and Samuel Marks and Oam Patel and Andy Zou and Mantas Mazeika and Zifan Wang and Palash Oswal and Weiran Lin and Adam A. Hunt and Justin Tienken-Harder and Kevin Y. Shih and Kemper Talley and John Guan and Russell Kaplan and Ian Steneker and David Campbell and Brad Jokubaitis and Alex Levinson and Jean Wang and William Qian and Kallol Krishna Karmakar and Steven Basart and Stephen Fitz and Mindy Levine and Ponnurangam Kumaraguru and Uday Tupakula and Vijay Varadharajan and Ruoyu Wang and Yan Shoshitaishvili and Jimmy Ba and Kevin M. Esvelt and Alexandr Wang and Dan Hendrycks},
journal= {arXiv preprint arXiv:2403.03218},
year = {2024}
}
备注
See the project page at https://wmdp.ai