深入毒性兔子洞:一种用于偏见审计大语言模型的新框架
计算与语言
2024-04-02 v4 计算机与社会
摘要
本文做出了三项贡献。首先,提出了一个名为“毒性兔子洞”(toxicity rabbit hole)的通用新颖框架,该框架可迭代地从一系列大语言模型中引出有毒内容。涵盖 1,266 个身份群体,我们首先对 \texttt{PaLM 2} 的防护栏进行了偏见审计并给出关键洞见。接下来,我们报告了在其他若干模型上的可泛化性。通过引出的有毒内容,我们进行了广泛分析,重点强调种族主义、反犹太主义、厌女症、伊斯兰恐惧症、同性恋恐惧症等。最后,在具体例子的驱动下,我们讨论了潜在影响。
引用
@article{arxiv.2309.06415,
title = {Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models},
author = {Arka Dutta and Adel Khorramrouz and Sujan Dutta and Ashiqur R. KhudaBukhsh},
journal= {arXiv preprint arXiv:2309.06415},
year = {2024}
}