中文

无损防蒸馈抽样

机器学习 2026-05-20 v1 密码学与安全

摘要

前沿商业生成式模型正面临来自蒸馈的日益增长威胁,即蒸馈者收集生成响应并在成本大幅降低的情况下训练自己的竞争模型。现有防御措施要么依赖修改模型输出,从而牺牲为好人用户的响应质量,要么依赖行为检测方法,这些方法可以轻易通过在多个帐户之间分发查询来规避。本文提出无损防蒸馈抽样(LADS),这是一种专为针对多帐户蒸馈而设计的新型抽样方案,同时保持对好人用户无损体验。具体而言,LADS从查询语义内容和用户查询次数确定的私有种子中派生出每次生成的随机性。按照设计,每个好人用户在每次访问时都会收到与原始模型独立抽样的响应,从而无需产生任何扭曲。相比之下,对于蒸馈者,不同帐户在其查询落在同一语义桶时共享潜在随机性。因此,收集的数据变得相关,这可能降低样本多样性并损害泛化能力。我们使用均匀收敛理论,证明LADS在无条件和条件生成设置中,对蒸馈者的泛化间隙收敛率明显劣于标准独立同分布抽样。在图像生成、数学推理和代码生成实验中,我们证明LADS显著降低了蒸馈学生的性能,同时保持对单个用户的完全统计保真。

关键词

引用

@article{arxiv.2605.18829,
  title  = {Lossless Anti-Distillation Sampling},
  author = {Zibo Diao and Jingchu Gai and Xinyue Ai and Zhang Zhang and Zhenyu He and Di He},
  journal= {arXiv preprint arXiv:2605.18829},
  year   = {2026}
}