中文

通过事实打败有害刻板印象:基于RAG的反言生成

计算与语言 2025-10-15 v1

摘要

反言生成是许多专家活动的核心,如事实核查和仇恨言论,以反驳有害内容。然而,现有工作将反言生成视为纯文本生成任务,主要基于大型语言模型或NGO专家。这些方法由于生成反言文本的可靠性和连贯性有限,以及可扩展性差,存在严重缺陷。为弥合这一差距,我们引入了一个新框架,将反言生成建模为知识导向的文本生成过程。我们的框架集成了先进的检索增强生成(RAG)管道,以确保为8个主要目标群体(包括女性、种族裔人员、残疾人、移民、穆斯林、犹太人、LGBT人员及其他)生成可信的反言。我们构建了一个知识库,包含联合国数字图书馆、欧盟法律数据库和欧盟基本权利机构,总计32,792篇文本。我们使用MultiTarget-CONAN数据集来评估生成反言的质量,既通过标准指标(如JudgeLM),也通过人类评估。结果表明,我们的框架在两项评估中均优于标准LLM基线和竞争方法。所得框架和知识库为研究可信且扎实的反言生成,以及更多领域的仇恨言论研究奠定了基础。

关键词

引用

@article{arxiv.2510.12316,
  title  = {Beating Harmful Stereotypes Through Facts: RAG-based Counter-speech Generation},
  author = {Greta Damo and Elena Cabrio and Serena Villata},
  journal= {arXiv preprint arXiv:2510.12316},
  year   = {2025}
}