束缚内在恶魔:语言模型的自解毒
计算与语言
2022-03-08 v1 人工智能
机器学习
摘要
语言模型(LMs)会复现(或放大)训练期间所见的毒性语言,这对其实际应用构成风险。本文中我们进行了大量实验来研究这一现象。我们分析了提示、解码策略以及训练语料对输出毒性的影响。基于我们的发现,我们提出了一种简单而有效的方法,使语言模型无需额外大型语料或外部判别器即可“解毒”自身。与有监督基线相比,我们所提方法在多种设置下展现出更好的毒性削减效果,且生成内容具有良好的生成质量。警告:文中所示部分示例可能包含未经审查的冒犯性内容。
引用
@article{arxiv.2203.03072,
title = {Leashing the Inner Demons: Self-Detoxification for Language Models},
author = {Canwen Xu and Zexue He and Zhankui He and Julian McAuley},
journal= {arXiv preprint arXiv:2203.03072},
year = {2022}
}
备注
AAAI 2022