RealToxicityPrompts:评估语言模型中的神经毒性退化
计算与语言
2020-09-29 v2
摘要
预训练神经语言模型(LM)易于生成种族主义、性别歧视或其他有毒语言,这阻碍了它们的安全部署。我们研究了预训练 LM 在提示下生成有毒语言的程度,以及可控文本生成算法在防止此类毒性退化方面的有效性。我们创建并发布了 RealToxicityPrompts,这是一个由从大型英语网络文本语料库衍生的 10 万条自然发生的句子级提示组成的数据集,并配有广泛使用的毒性分类器的毒性分数。使用 RealToxicityPrompts,我们发现预训练 LM 即使从看似无害的提示也可能退化为有毒文本。我们实证评估了几种可控生成方法,发现虽然数据或计算密集型方法(例如在非毒性数据上的自适应预训练)比简单方案(例如禁用“坏”词)更能有效规避毒性,但当前没有一种方法能绝对防止神经毒性退化。为查明此类持续性毒性退化的潜在原因,我们分析了用于预训练若干 LM(包括 GPT-2;Radford 等,2019)的两个网络文本语料库,发现了大量的攻击性、事实不可靠及其他有毒内容。我们的工作为评估 LM 的有毒生成提供了测试平台,并强调了预训练需要更好的数据选择过程。
引用
@article{arxiv.2009.11462,
title = {RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models},
author = {Samuel Gehman and Suchin Gururangan and Maarten Sap and Yejin Choi and Noah A. Smith},
journal= {arXiv preprint arXiv:2009.11462},
year = {2020}
}
备注
Findings in EMNLP 2020