中文

束缚内在恶魔:语言模型的自解毒

计算与语言 2022-03-08 v1 人工智能 机器学习

摘要

语言模型(LMs)会复现(或放大)训练期间所见的毒性语言,这对其实际应用构成风险。本文中我们进行了大量实验来研究这一现象。我们分析了提示、解码策略以及训练语料对输出毒性的影响。基于我们的发现,我们提出了一种简单而有效的方法,使语言模型无需额外大型语料或外部判别器即可“解毒”自身。与有监督基线相比,我们所提方法在多种设置下展现出更好的毒性削减效果,且生成内容具有良好的生成质量。警告:文中所示部分示例可能包含未经审查的冒犯性内容。

关键词

引用

@article{arxiv.2203.03072,
  title  = {Leashing the Inner Demons: Self-Detoxification for Language Models},
  author = {Canwen Xu and Zexue He and Zhankui He and Julian McAuley},
  journal= {arXiv preprint arXiv:2203.03072},
  year   = {2022}
}

备注

AAAI 2022