中文

面向大语言模型的红队测试以诱导社会偏见

计算与语言 2025-05-23 v2 机器学习

摘要

确保AI系统在行业环境中的安全部署至关重要,因为偏见输出可能导致重大的运营、声誉和监管风险。在部署前进行彻底的评估是防止这些风险的必不可少的措施。红队测试通过采用对抗性攻击来开发警戒措施,以检测并拒绝偏见或有害查询,使模型能够被重新训练或引导远离有害输出。然而,大多数红队测试工作集中于有害或不道德的指令,而不关注社会偏见,尽管社会偏见在现实世界影响巨大,尤其在面向客户的系统中仍未得到充分探索。我们提出两种特定于偏见的红队测试方法:情感偏见探针(EBP)和BiasKG,用于评估标准安全措施对偏见的影响。对于BiasKG,我们将自然语言刻板印象重构为知识图谱。我们使用这些攻击策略诱导几个开放和封闭源语言模型产生偏见响应。与先前工作不同,这些方法特别针对社会偏见。我们发现我们的方法在所有模型中均能提升偏见,包括那些配合安全警戒措施训练的模型。我们的工作强调通过严格评估揭示大语言模型中的社会偏见,并建议措施确保高风险行业部署中的AI安全。

关键词

引用

@article{arxiv.2405.04756,
  title  = {Red-Teaming for Inducing Societal Bias in Large Language Models},
  author = {Chu Fei Luo and Ahmad Ghawanmeh and Bharat Bhimshetty and Kashyap Murali and Murli Jadhav and Xiaodan Zhu and Faiza Khan Khattak},
  journal= {arXiv preprint arXiv:2405.04756},
  year   = {2025}
}