中文

知识蒸馏中的自适应加权:面向多尺度教师集成的公理化框架

机器学习 2026-01-27 v1

摘要

多教师知识蒸馏被日益广泛地用于提升鲁棒性、效率与安全性,但现有方法很大程度上依赖于启发式或特定实现加权的方案。本文开发了一个与算子无关的公理化框架,用于在 token、任务和上下文这三个互补尺度上进行多教师知识蒸馏的自适应加权。我们形式化了自适应加权算子良好定义的结构条件,表明其允许存在多种非等价实现,并可通过乘积结构归一化进行分层组合。在该框架内,我们证明了符合条件算子的存在性与非唯一性,刻画了标准假设下基于梯度优化的收敛性,分析了稳定性与扰动鲁棒性,并提供了安全约束蒸馏的抽象形式化。这些结果将理论保证与特定加权公式解耦,实现了在异质性、分布偏移与安全约束下对自适应蒸馏方法的原则性分析。

关键词

引用

@article{arxiv.2601.17910,
  title  = {Adaptive Weighting in Knowledge Distillation: An Axiomatic Framework for Multi-Scale Teacher Ensemble Optimization},
  author = {Aaron R. Flouro and Shawn P. Chadwick},
  journal= {arXiv preprint arXiv:2601.17910},
  year   = {2026}
}

备注

12 pages, 1 figure, 1 table