中文

异构带宽预算下联合探针-逻辑蒸馏的匹配速率与最优分配

机器学习 2026-05-29 v1 信息论 机器学习 math.IT

摘要

在联邦语言建模中,K 个节点每个持有 n 个样本,但无法汇集数据或交换完整精度梯度或权重。我们研究当每个节点在公共探针集上最多上传 B 位比特时,条件分布对 V 个 token 的估计的 minimax 速率。在联合探针-逻辑蒸馏(FPLD)中,每个节点在探针集上传输标量量化逻辑向量,聚合器对其进行蒸馏以获得全局参数学生。先前工作(Dubey 和 Huo,2026)建立了高概率 KL 速率 O(d/(Kn)+ρVlogV/m+K122B/V)O(d/(Kn) + \rho\sqrt{V \log V / m} + K^{-1} \cdot 2^{-2B/V}) 加上优化松弛,其中带宽项采用其 trace-sharpened 形式。本文消除了这两个悬而未决问题:首先,在非退化条件下,dithered FPLD 构造具有匹配的单轮下界 Ω(K122B/V)\Omega(K^{-1} \cdot 2^{-2B/V}),从而将带宽轴速率固定在 Θ(K122B/V)\Theta(K^{-1} \cdot 2^{-2B/V})。T 轮顺序细化采用嵌套/缩放残差量化器可达到 O(K122TB/V)O(K^{-1} \cdot 2^{-2TB/V});vanilla FPLD 的 T 独立带宽项在 T > 1 时次优。其次,我们建立了针对节点预算 BiB_i 的异构带宽上界,并给出闭式最优分配 Bi=Btot/K+(V/2)log2(wi/wˉg)B_i^* = B_{\mathrm{tot}}/K + (V/2) \log_2(w_i / \bar{w}_g),这是一种以 log-tilted 水位填充规则,相当于反向水位填充用于失真-率优化的 per-node 类比。一种插值自适应变体从短暂的 warm-up 阶段估计权重,实现 1+O(log(K/δ)/(mT0))1 + O(\sqrt{\log(K/\delta)/(m T_0)}) 相对次优。合成 n-gram 仿真确认经验 KL 位于上界和下界之间,最优分配在异构裁剪下严格优于均匀分配和反比例加权基线。

关键词

引用

@article{arxiv.2605.29642,
  title  = {Matching Rates and Optimal Allocation for Federated Probe-Logit Distillation under Heterogeneous Bandwidth Budgets},
  author = {Prasanjit Dubey and Xiaoming Huo},
  journal= {arXiv preprint arXiv:2605.29642},
  year   = {2026}
}