RAG大型语言模型并非更安全:检索增强生成的安全性分析
计算与语言
2025-04-28 v1 人工智能
摘要
确保大型语言模型(LLM)安全的努力包括安全微调、评估和红队测试。然而,尽管检索增强生成(RAG)框架广泛使用,但AI安全工作侧重于标准LLM,这意味着我们对RAG用例如何改变模型安全配置文件知之甚少。我们对RAG与非RAG框架中十一个LLM进行详细的比较分析。我们发现RAG可能使模型变得不安全并改变其安全配置文件。我们探讨了这种变化的原因,发现即使将安全模型与安全文档组合,也可能导致不安全的生成。此外,我们评估了现有针对RAG设置的红队测试方法,表明它们在非RAG设置中使用时效果较差。我们的工作凸显了针对RAG LLM的安全研究和红队测试方法的必要性。
引用
@article{arxiv.2504.18041,
title = {RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models},
author = {Bang An and Shiyue Zhang and Mark Dredze},
journal= {arXiv preprint arXiv:2504.18041},
year = {2025}
}
备注
NAACL 2025