通过反事实生成消除文本毒性
计算与语言
2025-05-29 v3
摘要
文本毒性消除 consist 在于重新表述文本以去除冒犯或有害意义。神经自然语言处理(NLP)模型已被广泛用于针对和消除文本毒性。然而,现有方法在同时保持初始非毒性意义方面未能有效消除文本。本文中,我们提出应用来自可解释人工智能(XAI)领域的反事实生成方法来针对和消除文本毒性。特别地,我们通过对区分有毒和非有毒文本的毒性分类器应用局部特征重要性和反事实生成方法来进行文本消除。我们通过在三个数据集上进行反事实生成来进行文本消除,并将我们的方案与三个竞争者进行比较。自动和人类评估表明,最近developed的 NLP 反事实生成器能够在与经典消除方法相比,更准确地消除毒性,同时更好地保持初始文本的意义。最后,我们站出来看使用自动化消除工具,讨论如何管理毒性的多义性以及滥用消除工具的风险。本工作是首次将反事实生成与文本消除建立联系,并为更实用的 XAI 方法铺平了道路。
引用
@article{arxiv.2405.09948,
title = {Mitigating Text Toxicity with Counterfactual Generation},
author = {Milan Bhan and Jean-Noel Vittaut and Nina Achache and Victor Legrand and Nicolas Chesneau and Annabelle Blangero and Juliette Murris and Marie-Jeanne Lesot},
journal= {arXiv preprint arXiv:2405.09948},
year = {2025}
}