对语言模型进行红队测试以减少危害:方法、规模行为与经验教训
计算与语言
2022-11-24 v2 人工智能
计算机与社会
摘要
我们描述了早期对语言模型进行红队测试(red teaming)以同时发现、度量并试图减少其潜在有害输出的努力。我们作出三项主要贡献。首先,我们研究了跨 3 种模型规模(2.7B、13B 和 52B 参数)和 4 种模型类型的红队测试规模行为:普通语言模型(LM);被提示为有帮助、诚实且无害的 LM;带拒绝采样的 LM;以及使用来自人类反馈的强化学习(RLHF)训练为有帮助且无害的模型。我们发现 RLHF 模型随规模增大越来越难以红队测试,而其他模型类型随规模呈平坦趋势。其次,我们发布包含 38,961 次红队攻击的数据集供他人分析与学习。我们提供了对数据的自身分析,发现了从攻击性语言到更微妙的非暴力不道德有害输出的多种有害输出。第三,我们详尽描述了关于红队测试的指令、流程、统计方法论与不确定性。我们希望这种透明性能加速我们作为一个共同体协作开发关于如何对语言模型进行红队测试的共享规范、实践和技术标准的能力。
引用
@article{arxiv.2209.07858,
title = {Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned},
author = {Deep Ganguli and Liane Lovitt and Jackson Kernion and Amanda Askell and Yuntao Bai and Saurav Kadavath and Ben Mann and Ethan Perez and Nicholas Schiefer and Kamal Ndousse and Andy Jones and Sam Bowman and Anna Chen and Tom Conerly and Nova DasSarma and Dawn Drain and Nelson Elhage and Sheer El-Showk and Stanislav Fort and Zac Hatfield-Dodds and Tom Henighan and Danny Hernandez and Tristan Hume and Josh Jacobson and Scott Johnston and Shauna Kravec and Catherine Olsson and Sam Ringer and Eli Tran-Johnson and Dario Amodei and Tom Brown and Nicholas Joseph and Sam McCandlish and Chris Olah and Jared Kaplan and Jack Clark},
journal= {arXiv preprint arXiv:2209.07858},
year = {2022}
}