面向企业的安全多特征 RAG:混合知识检索与安全过滤
计算与语言
2025-07-18 v2
摘要
现有的检索增强生成(RAG)系统在企业环境中面临检索范围有限和数据安全风险等挑战。当相关内部文档不可用时,系统难以生成准确且完整的响应。此外,使用闭源大型语言模型(LLM)会引发暴露专有信息的担忧。为此,我们提出了安全多特征 RAG(SecMulti-RAG)框架,该框架不仅从内部文档检索,还从两个补充来源检索:为预期查询生成的专家知识以及按需从外部 LLM 生成的知识。为缓解安全风险,我们采用本地开源生成器,并在提示被安全过滤机制判定为安全时仅选择性地利用外部 LLM。该方法提高了完整性,防止了数据泄露,降低了成本。在我们对汽车行业报告生成任务的评估中,SecMulti-RAG 在正确性、丰富性和有用性方面分别实现了 79.3% 到 91.9% 的胜率(基于 LLM 的评估),以及 56.3% 到 70.4% 的人类评估。这突显了 SecMulti-RAG 作为企业 RAG 的实用且安全解决方案。
引用
@article{arxiv.2504.13425,
title = {Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering},
author = {Grace Byun and Shinsun Lee and Nayoung Choi and Jinho D. Choi},
journal= {arXiv preprint arXiv:2504.13425},
year = {2025}
}