利用条件似然过滤缓解语言模型中的有害内容
计算与语言
2021-11-30 v3 机器学习
摘要
在从开放网络整理的大规模未过滤数据集上训练的语言模型,会从训练数据中习得系统性偏见、成见与有害观点。我们提出了一种以程序化方式识别并移除网络规模数据集中有害文本的方法。使用一个预训练语言模型来计算研究者撰写的触发短语在特定文档条件下的对数似然,并据此识别并过滤数据集中的文档。我们证明,在该过滤数据集上训练的模型生成有害文本的倾向更低,且在标准语言建模基准上的性能相较于未过滤基线仅有边际下降。我们通过从标准语言建模基准中揭示仇恨言论及其他不良内容的实例,对这一性能差距给出了部分解释。最后,我们讨论了该方法的泛化性,以及反映特定价值观的触发短语如何被研究者用来构建更贴近其价值观的语言模型。
引用
@article{arxiv.2108.07790,
title = {Mitigating harm in language models with conditional-likelihood filtration},
author = {Helen Ngo and Cooper Raterink and João G. M. Araújo and Ivan Zhang and Carol Chen and Adrien Morisot and Nicholas Frosst},
journal= {arXiv preprint arXiv:2108.07790},
year = {2021}
}