RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
计算与语言
2025-10-08 v1 人工智能
摘要
随着大型语言模型(LLM)的广泛采用,确保LLM系统安全性已成为迫切关切。外部基于LLM的护栏模型作为筛选不安全输入和输出的流行解决方案,然而它们本身也是经过微调或提示工程的LLM,在数据分布迁移方面存在脆弱性。在本文中,我们以检索增强生成(RAG)为案例研究,调查了基于LLM的护栏在面对上下文中嵌入的额外信息时的鲁棒性。通过对3个Llama护栏和2个GPT-oss模型进行系统评估,我们确认将良性文档插入护栏上下文会在约11%和8%的情况下改变输入和输出护栏的判断,使其不可靠。我们单独分析了增强上下文中每个组件的影响:检索文档、用户查询和LLM生成的响应。我们测试的两种缓解方法仅带来轻微改进。这些结果揭示了当前护栏在上下文鲁棒性方面的差距,并动机了对检索和查询组合具有鲁棒性的训练和评估协议。
引用
@article{arxiv.2510.05310,
title = {RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts},
author = {Yining She and Daniel W. Peterson and Marianne Menglin Liu and Vikas Upadhyay and Mohammad Hossein Chaghazardi and Eunsuk Kang and Dan Roth},
journal= {arXiv preprint arXiv:2510.05310},
year = {2025}
}