中文

利用语言模型对语言模型进行红队测试

计算与语言 2022-02-08 v1 人工智能 密码学与安全 机器学习

摘要

语言模型(LM)常因其可能以难以预测的方式伤害用户而无法部署。先前工作通过人工标注者手写测试用例,在部署前识别有害行为。然而,人工标注成本高昂,限制了测试用例的数量与多样性。在本工作中,我们通过使用另一个LM生成测试用例(“红队测试”)来自动发现目标LM表现出有害行为的情形。我们使用训练用于检测攻击性内容的分类器评估目标LM对生成测试问题的回复,在一个280B参数的LM聊天机器人中揭示了数万条攻击性回复。我们探索了从零样本生成到强化学习等多种方法,以生成具有不同多样性与难度的测试用例。此外,我们利用提示工程控制LM生成的测试用例,以揭示各类其他危害:自动发现聊天机器人以攻击性方式讨论的人群群体、作为聊天机器人自身联系信息生成的个人与医院电话号码、生成文本中私有训练数据的泄露,以及发生在对话过程中的危害。总体而言,基于LM的红队测试是一种(在众多所需工具中的)有前景的工具,用于在影响用户前发现并修复多样且不良好的LM行为。

关键词

引用

@article{arxiv.2202.03286,
  title  = {Red Teaming Language Models with Language Models},
  author = {Ethan Perez and Saffron Huang and Francis Song and Trevor Cai and Roman Ring and John Aslanides and Amelia Glaese and Nat McAleese and Geoffrey Irving},
  journal= {arXiv preprint arXiv:2202.03286},
  year   = {2022}
}