面向大模型审计:改进基于文本的刻板印象检测
计算与语言
2023-11-27 v1 人工智能
计算机与社会
机器学习
摘要
大型语言模型(LLM)近期取得显著进展,在人工智能(AI)赋能的面向人类应用中愈发主流。然而,LLM 常生成继承自历史数据的刻板印象输出,放大社会偏见并引发伦理担忧。本工作提出 i) 多粒度刻板印象数据集,包含 52,751 条性别、种族、职业与宗教刻板印象文本实例;以及 ii) 一种新颖的英文文本刻板印象分类器。我们设计了若干实验以严格测试在该新数据集上训练的所提模型。实验表明,以多分类设定训练模型优于一对多二分类对应方法。来自不同可解释 AI(XAI)工具一致的特征重要性信号显示,新模型利用了相关文本特征。我们利用新创建的模型评估流行的 GPT 系列模型的刻板印象行为,并观察到偏见随时间减少。总之,我们的工作建立了用于审计和评估 LLM 中刻板印象偏见的稳健且实用的框架。
引用
@article{arxiv.2311.14126,
title = {Towards Auditing Large Language Models: Improving Text-based Stereotype Detection},
author = {Wu Zekun and Sahan Bulathwela and Adriano Soares Koshiyama},
journal= {arXiv preprint arXiv:2311.14126},
year = {2023}
}
备注
2023 NeurIPS SoLaR Workshop Accepted