语言模型解毒有边缘化少数群体声音的风险
计算与语言
2021-04-14 v1 机器学习
摘要
语言模型(LMs)在实践中负责任地部署必须既安全又公平。出于安全考虑,已提出众多解毒技术(例如 Dathathri 等人 2020;Krause 等人 2020)来缓解有毒的 LM 生成内容。在本工作中,我们表明当前的解毒技术损害了公平性:它们降低了 LMs 在边缘化群体所用语言(例如非裔美国人英语和少数群体身份提及)上的效用。具体而言,我们在 LMs 以不同方言和群体标识符为条件时对文本生成质量进行了自动和人工评估。我们发现解毒使 LMs 对分布偏移更加脆弱,尤其是在边缘化群体所用的语言上。我们识别出这些失败源于解毒方法利用了毒性数据集中的伪相关。总体而言,我们的结果凸显了 LMs 的可控性与分布鲁棒性之间的张力。
引用
@article{arxiv.2104.06390,
title = {Detoxifying Language Models Risks Marginalizing Minority Voices},
author = {Albert Xu and Eshaan Pathak and Eric Wallace and Suchin Gururangan and Maarten Sap and Dan Klein},
journal= {arXiv preprint arXiv:2104.06390},
year = {2021}
}
备注
NAACL 2021