STAR:面向语言模型的社会技术红队测试框架
人工智能
2024-10-24 v4 计算与语言
计算机与社会
人机交互
摘要
本研究引入 STAR 框架,这是一个社会技术方法,改进了当前面向大语言模型安全红队测试的最佳实践。STAR 的两个关键贡献:一是通过生成参数化指令增强可驾驭性,提高了风险表面覆盖率。参数化指令还能在不增加成本的情况下提供更详细的模型失效见解。二是通过匹配人口统计学特征评估特定群体的伤害,提高信号质量,实现更敏感的注释。STAR 还采用一种新颖的仲裁步骤,利用多元观点提升标签可靠性,将不同意见不视为噪声,而是视为信号质量的有价值贡献。
引用
@article{arxiv.2406.11757,
title = {STAR: SocioTechnical Approach to Red Teaming Language Models},
author = {Laura Weidinger and John Mellor and Bernat Guillen Pegueroles and Nahema Marchal and Ravin Kumar and Kristian Lum and Canfer Akbulut and Mark Diaz and Stevie Bergman and Mikel Rodriguez and Verena Rieser and William Isaac},
journal= {arXiv preprint arXiv:2406.11757},
year = {2024}
}
备注
8 pages, 5 figures, 5 pages appendix. * denotes equal contribution