使用大型预训练神经模型进行文本解毒
计算与语言
2021-11-04 v2 机器学习
摘要
我们提出了两种用于消除文本中毒性的新颖无监督方法。我们的第一种方法结合了两个近期思路:(1) 以小型风格条件语言模型引导生成过程;(2) 使用复述模型执行风格迁移。我们采用由风格训练语言模型引导的高性能复述器来保留文本内容并去除毒性。我们的第二种方法使用 BERT 将毒性词替换为其非冒犯性同义词。我们通过让 BERT 以可变数量的词替换掩码标记,使该方法更加灵活。最后,我们展示了首个关于毒性去除任务的风格迁移模型大规模对比研究。我们将我们的模型与多种风格迁移方法进行比较。模型以无参考方式使用无监督风格迁移指标的组合进行评估。我们提出的两种方法均取得了新的 SOTA 结果。
引用
@article{arxiv.2109.08914,
title = {Text Detoxification using Large Pre-trained Neural Models},
author = {David Dale and Anton Voronov and Daryna Dementieva and Varvara Logacheva and Olga Kozlova and Nikita Semenov and Alexander Panchenko},
journal= {arXiv preprint arXiv:2109.08914},
year = {2021}
}
备注
Accepted to the EMNLP 2021 conference