中文

RoTRAG:基于检索增强生成的对话 harm 检测规则

计算与语言 2026-04-21 v1 人工智能 人机交互 信息检索 机器学习

摘要

检测多轮对话中的有害内容需要对整个对话上下文进行推理,而不是仅针对单个utterance。然而,大多数现有方法主要依赖模型内部的参数知识,缺乏对外部规范性原则的显式 grounding。这常导致在社交细微情境中判断不一致、可解释性有限以及跨轮冗余推理。为此,我们提出 RoTRAG,一种检索增强框架,将简洁的人类编写的道德规范(Rules of Thumb, RoTs)融入基于 LLM 的 harm 评估中。对于每一轮,RoTRAG 从外部语料库检索相关 RoTs,并将其作为轮级推理和最终严重程度分类的显式规范性证据。为提高效率,我们进一步引入轻量级的二元路由分类器,用于决定新一轮是否需要基于检索的推理,或可以重用现有上下文。在 ProsocialDialog 和 Safety Reasoning Multi Turn Dialogue 上的实验表明,RoTRAG 在有害分类和严重程度估计方面均显著优于竞争基线,在基准数据集上 F1 分数提升约 40%,分布式误差降低约 8.4%,同时在不牺牲性能的情况下减少了冗余计算。

关键词

引用

@article{arxiv.2604.17301,
  title  = {RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation},
  author = {Juhyeon Lee and Wonduk Seo and Junseo Koh and Seunghyun Lee and Haihua Chen and Yi Bu},
  journal= {arXiv preprint arXiv:2604.17301},
  year   = {2026}
}

备注

20 pages, 10 figures (Under Review)