利用语言模型对语言模型进行红队测试
计算与语言
2022-02-08 v1 人工智能
密码学与安全
机器学习
摘要
语言模型(LM)常因其可能以难以预测的方式伤害用户而无法部署。先前工作通过人工标注者手写测试用例,在部署前识别有害行为。然而,人工标注成本高昂,限制了测试用例的数量与多样性。在本工作中,我们通过使用另一个LM生成测试用例(“红队测试”)来自动发现目标LM表现出有害行为的情形。我们使用训练用于检测攻击性内容的分类器评估目标LM对生成测试问题的回复,在一个280B参数的LM聊天机器人中揭示了数万条攻击性回复。我们探索了从零样本生成到强化学习等多种方法,以生成具有不同多样性与难度的测试用例。此外,我们利用提示工程控制LM生成的测试用例,以揭示各类其他危害:自动发现聊天机器人以攻击性方式讨论的人群群体、作为聊天机器人自身联系信息生成的个人与医院电话号码、生成文本中私有训练数据的泄露,以及发生在对话过程中的危害。总体而言,基于LM的红队测试是一种(在众多所需工具中的)有前景的工具,用于在影响用户前发现并修复多样且不良好的LM行为。
引用
@article{arxiv.2202.03286,
title = {Red Teaming Language Models with Language Models},
author = {Ethan Perez and Saffron Huang and Francis Song and Trevor Cai and Roman Ring and John Aslanides and Amelia Glaese and Nat McAleese and Geoffrey Irving},
journal= {arXiv preprint arXiv:2202.03286},
year = {2022}
}