中文

抗蒸馈抽样

人工智能 2025-10-28 v5 计算与语言

摘要

前沿模型在生成扩展推理痕迹时,会不经意地产生丰富的token序列,这些序列可用于模型蒸馈。鉴于此漏洞,模型所有者可能会寻求限制蒸馈效果而不损害模型性能的抽样策略。抗蒸馈抽样正好提供了这种能力。通过战略性地修改模型的下一个token概率分布,抗蒸馈抽样“中毒”推理痕迹,使其对蒸馈显著不再有效,同时保留模型的实际实用性。详情请参见https://antidistillation.com。

关键词

引用

@article{arxiv.2504.13146,
  title  = {Antidistillation Sampling},
  author = {Yash Savani and Asher Trockman and Zhili Feng and Yixuan Even Xu and Avi Schwarzschild and Alexander Robey and Marc Finzi and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2504.13146},
  year   = {2025}
}