在预训练阶段加入指令:控制语言模型毒性的有效途径
计算与语言
2023-02-16 v1 人工智能
摘要
预训练大语言模型已成为解决各类自然语言处理(NLP)任务不可或缺的工具。然而,由于它们会生成有毒内容,将其安全部署于真实应用具有挑战性。为应对该挑战,我们提出两种新颖的预训练数据增强策略,可在不损害模型效用的前提下显著降低模型毒性。我们的两种策略为:(1)MEDA:将原始毒性分数作为元数据加入预训练样本;(2)INST:向这些样本加入指示其毒性的指令。我们的结果表明,表现最优的策略(INST)在保持五项基准 NLP 任务准确率的同时,将毒性概率降低多达 61%,并将四项偏见检测任务的 AUC 分数提升 1.3%。我们还通过扩大训练样本数与模型参数量,证明了技术的可扩展性。
引用
@article{arxiv.2302.07388,
title = {Adding Instructions during Pretraining: Effective Way of Controlling Toxicity in Language Models},
author = {Shrimai Prabhumoye and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2302.07388},
year = {2023}
}
备注
This paper will be presented at EACL 2023