面向数据敏感检索增强生成的隐私政策执行护栏
机器学习
2026-05-19 v1 人工智能
密码学与安全
摘要
标准的个人身份信息(PII)过滤器常常无法捕获 RAG 系统中上下文数据泄露问题,例如综合了多个非受监管属性聚类却能够识别个体的情况。我们引入了基于双 one-class 密度估计的隐私政策执行(PPE)框架,采用融合文本嵌入并配备校准的否决区域,以处理分布外输入。使用一个沿用轴的分层、多 LLM 合成数据管道覆盖医疗、金融和法律领域,我们发现传统的高斯混合模型基线在边缘安全测试中会失败,原因是它们关注的是语言注册而非内容。我们提出的 T3+OCSVM 检测器在安全和边缘安全数据上训练,实现了边缘 AUROC 达到 0.93+,同时将误报率降低 44-55 个百分点,保持毫秒级延迟。与受监督的 MLP 分类器或 14B 参数 LLM 判官相比,我们的框架在操作可行性方面具有优势,前者 suffers from 高否决率,后者则因延迟和校准问题。该方法为任何基于合成数据的分类器提供了稳健的压力测试标准。
引用
@article{arxiv.2605.17034,
title = {Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation},
author = {Osama Zafar and Alexander Nemecek and Yiqian Zhang and Wenbiao Li and Debargha Ganguly and Vikash Singh and Vipin Chaudhary and Erman Ayday},
journal= {arXiv preprint arXiv:2605.17034},
year = {2026}
}