使用 MaRCo 进行文本去毒:基于专家与反专家的可控修改
计算与语言
2023-05-30 v2 人工智能
摘要
文本去毒通过改写文本以消除冒犯性含义,有望减轻毒性的危害,但隐性毒性仍然难以处理。我们引入了 MaRCo,这是一种去毒算法,结合了可控生成与文本重写方法,使用了带有自编码器语言模型(LMs)的专家乘积。MaRCo 利用非毒性 LM(专家)和毒性 LM(反专家)下的似然来寻找候选词进行掩码并可能替换。我们在几个隐性毒性和微冒犯数据集上评估了我们的方法,并表明它不仅在自动指标上优于基线,而且在人工评估中 MaRCo 的重写被偏好的程度高出 2.1 。它对隐性毒性实例的适用性尤其有前景,展示了解决日益隐蔽的网络仇恨的途径。
引用
@article{arxiv.2212.10543,
title = {Detoxifying Text with MaRCo: Controllable Revision with Experts and Anti-Experts},
author = {Skyler Hallinan and Alisa Liu and Yejin Choi and Maarten Sap},
journal= {arXiv preprint arXiv:2212.10543},
year = {2023}
}