无冒犯之意:从语言模型中诱发攻击性
计算与语言
2023-10-03 v1 人工智能
摘要
本工作于 2022 年 5 月完成。为使语言模型在现实世界中安全可靠的部署,测试需要具备鲁棒性。这种鲁棒性可由我们用以评估这些模型的测试用例的难度与多样性来刻画。人工参与测试用例生成的局限性催生了自动化测试用例生成方法的兴起。我们特别关注 Perez 等人(2022)提出的用语言模型对语言模型进行红队测试(Red Teaming Language Models with Language Models)。我们的贡献包括:开发了一条通过红队测试实现自动化测试用例生成的流水线,其利用了公开可用的较小语言模型(LMs);尝试了不同的目标 LMs 与红队分类器;并生成了一个测试用例语料库,有助于从广泛部署的 LMs 中诱发攻击性回复并识别其失效模式。
引用
@article{arxiv.2310.00892,
title = {No Offense Taken: Eliciting Offensiveness from Language Models},
author = {Anugya Srivastava and Rahul Ahuja and Rohith Mukku},
journal= {arXiv preprint arXiv:2310.00892},
year = {2023}
}