用于缓解 Transformer 语言模型毒性的奖励建模
计算与语言
2022-07-28 v6 人工智能
摘要
基于 Transformer 的语言模型能够生成流畅文本,并可高效适配各类自然语言生成任务。然而,在大规模无标注网络文本语料上预训练的语言模型已被证实存在毒性内容退化与社会偏见行为,从而阻碍其安全部署。已有多种解毒方法被提出以缓解语言模型毒性;但这些方法在以涉及性别、种族或宗教的特定社会身份为条件时,难以对语言模型解毒。本研究中,我们提出 Reinforce-Detoxify;一种基于强化学习的方法,用于缓解语言模型中的毒性。我们应对语言模型安全性挑战,并提出一种新的奖励模型,能够检测毒性内容并缓解毒性预测中对社会身份的无意偏见。实验表明,用于语言模型解毒的 Reinforce-Detoxify 方法在自动评价指标上优于现有解毒方法,表明我们的方法在语言模型解毒方面的能力,且在生成内容中更不易对社会身份产生无意偏见。
引用
@article{arxiv.2202.09662,
title = {Reward Modeling for Mitigating Toxicity in Transformer-based Language Models},
author = {Farshid Faal and Ketra Schmitt and Jia Yuan Yu},
journal= {arXiv preprint arXiv:2202.09662},
year = {2022}
}