中文

分类是一个 RAG 问题:仇恨言论检测的案例研究

计算与语言 2025-08-11 v1 人工智能 机器学习

摘要

鲁棒的内容审核需要能够快速适应不断变化的政策而无需昂贵重训练的分类系统。我们提出了使用检索增强生成(RAG)的分类方法,该方法将传统的分类任务从根据预训练参数确定正确类别转变为根据推理时检索到的上下文知识来评估内容。在仇恨言论检测中,这将任务从“这是仇恨言论吗?”转变为“这违反了仇恨言论政策吗?”。我们的上下文政策引擎(CPE)——一个智能体 RAG 系统——展示了这种方法,并提供了三个关键优势:(1)与领先的商业系统相当的鲁棒分类准确率,(2)通过检索到的政策片段实现固有的可解释性,以及(3)无需模型重训练的动态政策更新。通过三个实验,我们展示了强大的基线性能,并证明该系统可以通过正确调整对特定身份群体的保护来应用细粒度的政策控制,而无需重训练或损害整体性能。这些发现确立了 RAG 可以将分类转变为一种更灵活、更透明、更适应内容审核和更广泛分类问题的过程。

关键词

引用

@article{arxiv.2508.06204,
  title  = {Classification is a RAG problem: A case study on hate speech detection},
  author = {Richard Willats and Josh Pennington and Aravind Mohan and Bertie Vidgen},
  journal= {arXiv preprint arXiv:2508.06204},
  year   = {2025}
}