中文

HateRephrase:利用大语言模型对在线帖子仇恨强度进行零样本与少样本削减

计算与语言 2023-10-24 v1

摘要

仇恨言论在当今数字时代已变得普遍。尽管已有大量研究用于检测仇恨言论或生成反制言论以对抗仇恨观点,这些方法仍无法完全消除仇恨言论潜在的有害社会后果——仇恨言论即使被检测到,也常未被删除或删除得不够充分;且仇恨言论不幸地传播迅速,常远快于任何生成的反制言论。本文研究了一种相对新颖却简单有效的方法:在帖子发布前即建议对潜在仇恨言论内容进行改写。我们展示了大语言模型(LLMs)在该任务上表现良好,优于BART-Detox等最先进的基线。我们基于任务描述、仇恨定义、少样本示例和思维链开发了4种不同的提示以进行全面实验,并在LLaMA-1、LLaMA-2 chat、Vicuna等开源LLM以及OpenAI的GPT-3.5上开展实验。我们提出了多种评估指标来衡量生成文本的有效性,并确保生成文本在大幅不改变原文本语义的前提下降低了仇恨强度。我们发现,带有少样本示例提示的LLM在生成语义与原文本相近的可接受仇恨改写文本方面表现最佳。总体而言,我们发现GPT-3.5在所有不同类型提示上均优于基线和开源模型。我们还进行了人工评估,有趣的是,发现GPT-3.5生成的改写甚至优于数据集中人工生成的真实改写。我们也进行了详细的消融研究以探究LLM在该任务上表现满意的原因,并进行了失败分析以理解差距。

关键词

引用

@article{arxiv.2310.13985,
  title  = {HateRephrase: Zero- and Few-Shot Reduction of Hate Intensity in Online Posts using Large Language Models},
  author = {Vibhor Agarwal and Yu Chen and Nishanth Sastry},
  journal= {arXiv preprint arXiv:2310.13985},
  year   = {2023}
}