中文

LLM 在环:创建用于仇恨言论去毒化的 ParaDeHate 数据集

计算与语言 2025-06-09 v2

摘要

去毒化(detoxification)即将有害语言重写为非毒性文本的任务,随着在线毒性内容日益增多而变得愈发重要。然而,由于人工标注的成本与敏感性,用于去毒化的高质量平行数据集(尤其是仇恨言论方面)仍然稀缺。本文提出了一种利用 GPT-4o-mini 进行自动化去毒化的新型 LLM 在环(LLM-in-the-loop)流程。我们首先用 LLM 替代人工标注者复现了 ParaDetox 流程,并表明 LLM 的表现与人工标注相当。在此基础上,我们构建了 ParaDeHate,一个专门用于仇恨言论去毒化的大规模平行数据集。我们发布了 ParaDeHate 作为包含超过 8K 个仇恨/非仇恨文本对的基准测试,并评估了多种基线方法。实验结果表明,在 ParaDeHate 上微调的 BART 等模型在风格准确性、内容保留度和流畅性上取得了更好的性能,证明了 LLM 生成的去毒化文本作为人工标注的可扩展替代方案的有效性。

关键词

引用

@article{arxiv.2506.01484,
  title  = {LLM in the Loop: Creating the ParaDeHate Dataset for Hate Speech Detoxification},
  author = {Shuzhou Yuan and Ercong Nie and Lukas Kouba and Ashish Yashwanth Kangen and Helmut Schmid and Hinrich Schütze and Michael Färber},
  journal= {arXiv preprint arXiv:2506.01484},
  year   = {2025}
}