中文

Highlight & Summarize:无越狱的RAG

计算与语言 2026-02-16 v2 机器学习

摘要

防止大型语言模型(LLM)被越狱和模型劫持是一项重要但具有挑战性的任务。在与聊天机器人交互时,恶意用户可以输入特制提示,导致LLM生成不良内容或执行与其预期目的不同的任务。现有系统试图通过强化LLM的系统提示或使用额外的分类器来检测不良内容或偏题对话以缓解此问题。然而,由于可能的输入和不良输出的空间非常大,这些概率方法相对容易被绕过。我们提出并评估了Highlight & Summarize(H&S),这是一种用于检索增强生成(RAG)系统的新设计模式,通过设计来防止这些攻击。其核心思想是执行与标准RAG流水线相同的任务(即基于相关来源为问题提供自然语言答案),而不向生成式LLM透露用户的问题。这是通过将流水线分为两个组件来实现的:一个高亮器,接收用户的问题并从检索到的文档中提取(“高亮”)相关段落;一个摘要器,接收高亮的段落并将其总结为一个连贯的答案。我们描述并实现了H&S的几种可能实例,并从正确性、相关性和质量方面评估了它们的回答。对于某些问答(QA)任务,H&S生成的回答被判定为与标准RAG流水线一样好,甚至更好。

关键词

引用

@article{arxiv.2508.02872,
  title  = {Highlight & Summarize: RAG without the jailbreaks},
  author = {Giovanni Cherubin and Andrew Paverd},
  journal= {arXiv preprint arXiv:2508.02872},
  year   = {2026}
}