中文

基于梯度唯一性的大语言模型尺度梯度下降信息披露审计

机器学习 2026-03-04 v2 机器学习

摘要

通过发布机器学习模型来披露信息会带来显著的隐私风险。然而,在大语言模型(LLM)训练期间,对每一个数据点进行披露审计 computationally 代价高昂。本文提出了梯度唯一性(Gradient Uniqueness, GNQ),这是一种源自信息论上界的度量,用于量化通过梯度下降嵌入模型中关于单个训练点的信息量。这一度量是一种原则且通用的攻击中性指标。虽然 naively 计算 GNQ 需要为每个数据点构建并求逆一个 P×PP \times P 矩阵(其中 PP 为模型参数数量),但我们引入了批次空间幽灵 GNQ(Batch-Space Ghost GNQ, BS-Ghost GNQ)。该高效算法在更小的批次空间内执行所有计算,并利用幽灵核在运行时以最小的计算开销计算 GNQ。我们经验性地验证了 GNQ 成功地解释了先前/常见知识。我们的评估表明,GNQ 强烈预测了针对性攻击中的序列可提取性,并揭示了在 LLM 训练过程中,披露风险在特定示例上的异质性集中。

关键词

引用

@article{arxiv.2510.10902,
  title  = {Auditing Information Disclosure During LLM-Scale Gradient Descent Using Gradient Uniqueness},
  author = {Sleem Abdelghafar and Maryam Aliakbarpour and Chris Jermaine},
  journal= {arXiv preprint arXiv:2510.10902},
  year   = {2026}
}