利用基于 LLM 的合成数据生成增强搜索可加密的泄漏攻击
密码学与安全
2025-04-30 v1
摘要
搜索可加密(SSE)允许用户在保持隐私的同时利用云存储实现高效搜索。然而,SSE 方案因利用访问模式、搜索频率和卷积信息而暴露于泄漏攻击。现有研究常常假设攻击者拥有大量加密数据集的子集来发动有效推理攻击,这意味着存在此类文档的数据库泄漏,而这在现实情境下可能不成立。在本 work 中,我们研究了在攻击者仅拥有最小泄漏数据的情况下提升泄漏攻击的可行性。我们提出一种新方法,利用大型语言模型(LLM),具体为 GPT-4 变体,生成 statistically and semantics 上类似真实世界 Enron 邮件数据集的合成文档。以邮件语料库为案例研究,评估了通过随机抽样和层次聚类方法生成的合成数据对受限于 token 量的 SAP(Search Access Pattern)关键字推理攻击性能的影响。我们的结果表明,虽然 LLM 选择对性能影响有限,但增加数据集大小和采用基于聚类的生成方法显著提高了攻击准确率,使其能够相当于使用更大量真实数据的攻击性能。我们强调了 LLM 在对抗情境中的日益重要性。
引用
@article{arxiv.2504.20414,
title = {Enhancing Leakage Attacks on Searchable Symmetric Encryption Using LLM-Based Synthetic Data Generation},
author = {Joshua Chiu and Partha Protim Paul and Zahin Wahab},
journal= {arXiv preprint arXiv:2504.20414},
year = {2025}
}