中文

结果约束的大语言模型用于反击仇恨言论

计算与语言 2024-10-02 v2

摘要

自动反击言论生成方法已被开发出来,以协助打击仇恨言论。现有研究侧重于生成具有礼貌、信息丰富和意图驱动等语言属性的反击言论。然而,反击言论在网络环境中的实际影响却很少被考虑。本研究旨在开发受对话结果约束的反击言论生成方法,并评估其有效性。我们实验使用大语言模型(LLMs),将两个期望的对话结果——低对话不文明度和非仇恨的仇恨者重返——融入文本生成过程。具体而言,我们实验了指令提示、LLM微调和LLM强化学习(RL)。评估结果表明,我们的方法有效地引导反击言论的生成朝着期望的结果发展。然而,我们的分析显示,不同模型在质量和风格上存在差异。

关键词

引用

@article{arxiv.2403.17146,
  title  = {Outcome-Constrained Large Language Models for Countering Hate Speech},
  author = {Lingzi Hong and Pengcheng Luo and Eduardo Blanco and Xiaoying Song},
  journal= {arXiv preprint arXiv:2403.17146},
  year   = {2024}
}

备注

Accepted for presentation at the EMNLP 2024 main conference