中文

InvisibleInk:满足严格差分隐私保证的高效能低成本文本生成

机器学习 2026-05-06 v3 计算与语言 密码学与安全

摘要

随着大型语言模型(LLM)在长篇文本生成方面取得的显著进展,诸如检索增强生成(RAG)和推理时间扩展等范式正在涌现,但安全地将私人信息纳入生成过程仍是一个关键且尚未解决的难题。我们提出了 InvisibleInk,一个高度可扩展的长篇文本生成框架,能够对敏感参考文本提供严格的差分隐私保证。它将从 LLM 的下一个 token 分布进行采样,解释为对 LLM logits 的指数机制,包含两项创新。第一项是通过仅对模型 logits 中相对于公共 logits 的敏感信息进行隔离和裁剪来降低隐私成本。第二项是通过从小型私有 token 的子集中进行采样来提升文本质量,而无需任何隐私成本。实证评估显示,InvisibleInk 在各种隐私水平下生成相同实用性的私有长篇文本,计算成本显著降低 8 倍以上。InvisibleInk 首次能够以非私有生成计算成本的不到 4-8 倍,生成高质量的私有长篇文本,为其实际应用铺平了道路。我们开源了一个可通过 pip 安装的 Python 包(invink),地址为 https://github.com/cerai-iitm/invisibleink。

关键词

引用

@article{arxiv.2507.02974,
  title  = {InvisibleInk: High-Utility and Low-Cost Text Generation with Differential Privacy},
  author = {Vishnu Vinod and Krishna Pillutla and Abhradeep Guha Thakurta},
  journal= {arXiv preprint arXiv:2507.02974},
  year   = {2026}
}

备注

Published at NeurIPS 2025