中文

DetoxLLM:一个带有解释的去毒化框架

机器学习 2024-10-07 v2 计算与语言 计算机与社会

摘要

先前关于去毒化的工作在意义上是分散的,因为它们没有涵盖现实场景中所需的所有去毒化方面。值得注意的是,先前的工作将去毒化模型的开发任务仅限于已见的平台子集,留下了模型在未见过平台上的表现如何这一未探索的问题。此外,这些工作没有解决不可去毒性,即有毒文本在不改变含义的情况下无法被去毒化的现象。我们提出了 DetoxLLM,这是第一个全面的端到端去毒化框架,旨在缓解上述局限性。我们首先引入一个跨平台伪平行语料库,应用多步数据处理和生成策略,并利用 ChatGPT。然后,我们使用我们的跨平台语料库训练了一套去毒化模型。我们表明,我们的去毒化模型优于使用人工标注平行语料库训练的 SoTA 模型。我们进一步引入了解释以促进透明度和可信度。DetoxLLM 还提供了一个专门用于去毒化任务的独特复述检测器,以解决不可去毒化的情况。通过实验分析,我们证明了跨平台语料库的有效性以及 DetoxLLM 对抗对抗性毒性的鲁棒性。

关键词

引用

@article{arxiv.2402.15951,
  title  = {DetoxLLM: A Framework for Detoxification with Explanations},
  author = {Md Tawkat Islam Khondaker and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan},
  journal= {arXiv preprint arXiv:2402.15951},
  year   = {2024}
}

备注

EMNLP 2024 Main Conference