中文

ExpShield:保护网络文本免受未授权爬取与大语言模型滥用

密码学与安全 2025-12-17 v3

摘要

随着大型语言模型日益记忆网络爬取的训练内容,它们风险暴露版权或私人信息。现有保护措施需要爬虫或模型开发者的合规,根本上限制了其有效性。我们提出ExpShield,一种主动自我卫护的方案,通过不可见扰动在保持可读性的同时缓解记忆,同时我们将其形式化为受约束的优化问题。由于缺乏自然文本的单个层级风险度量,我们首先提出实例滥用(instance exploitation)度量标准,即衡量对特定文本进行训练后,从候选文本集合中猜测该文本概率的增量——零表示完美防御。由于缺乏足够知识的防御者无法直接求解该问题,因此我们开发两种有效的代理解决方案:单级优化和合成扰动。为增强防御,我们揭示并验证了记忆触发器假设,这有助于识别记忆的关键词。基于这一洞见,我们设计了针对性的扰动:(i) 中和固有触发词以减少记忆;(ii) 引入人工触发词以误导模型记忆。实验在攻击、模型规模和语言与视觉到语言建模任务中验证了该防御。即使存在隐私后门,成员推断攻击(MIA)的AUC从0.95降至0.55,且实例滥用 approaches 到零。这表明与理想的无滥用场景相比,尽管文本实例包含在训练数据中,其暴露风险几乎保持不变。

关键词

引用

@article{arxiv.2412.21123,
  title  = {ExpShield: Safeguarding Web Text from Unauthorized Crawling and LLM Exploitation},
  author = {Ruixuan Liu and Toan Tran and Tianhao Wang and Hongsheng Hu and Shuo Wang and Li Xiong},
  journal= {arXiv preprint arXiv:2412.21123},
  year   = {2025}
}

备注

18 pages