中文

基于Top-K封禁API访问的分布模型提取的识别集几何

机器学习 2026-05-12 v1

摘要

现代大语言模型API通常仅显示前K个logit得分并封禁其余词汇表。我们研究了这种访问模型的每位置分布恢复极限。对于封禁阈值τ,兼容的教师分布形成一个识别集,其总变差直径恰为Uk=(V-K)exp(τ)/(ZA+(V-K)exp(τ),其中ZA为观察到的分区函数。对于KL恢复,我们给出可计算的二元端点下界和与之相符的渐近小歧义上界,并给出针对参考感知攻击者的扩展。实验在Qwen3数学推理教师上揭示了分层提取层次:任务内top-K蒸馏恢复12%的私有能力,完整logit蒸馏恢复56%尽管99%KL闭合,生成式提取恢复96%。Top-K封禁因此限制了每位置分布恢复,但本身并不能防止能力提取,将保真度与提示式logit蒸馏中的转移能力分离。

关键词

引用

@article{arxiv.2605.10407,
  title  = {Identified-Set Geometry of Distributional Model Extraction under Top-$K$ Censored API Access},
  author = {Wenhua Nie and ZiCheng Zhu and Jianan Wu and Binhan Luo and Haoran Zheng and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2605.10407},
  year   = {2026}
}