异构带宽预算下联合探针-逻辑蒸馏的匹配速率与最优分配
机器学习
2026-05-29 v1 信息论
机器学习
math.IT
摘要
在联邦语言建模中,K 个节点每个持有 n 个样本,但无法汇集数据或交换完整精度梯度或权重。我们研究当每个节点在公共探针集上最多上传 B 位比特时,条件分布对 V 个 token 的估计的 minimax 速率。在联合探针-逻辑蒸馏(FPLD)中,每个节点在探针集上传输标量量化逻辑向量,聚合器对其进行蒸馏以获得全局参数学生。先前工作(Dubey 和 Huo,2026)建立了高概率 KL 速率 加上优化松弛,其中带宽项采用其 trace-sharpened 形式。本文消除了这两个悬而未决问题:首先,在非退化条件下,dithered FPLD 构造具有匹配的单轮下界 ,从而将带宽轴速率固定在 。T 轮顺序细化采用嵌套/缩放残差量化器可达到 ;vanilla FPLD 的 T 独立带宽项在 T > 1 时次优。其次,我们建立了针对节点预算 的异构带宽上界,并给出闭式最优分配 ,这是一种以 log-tilted 水位填充规则,相当于反向水位填充用于失真-率优化的 per-node 类比。一种插值自适应变体从短暂的 warm-up 阶段估计权重,实现 相对次优。合成 n-gram 仿真确认经验 KL 位于上界和下界之间,最优分配在异构裁剪下严格优于均匀分配和反比例加权基线。
引用
@article{arxiv.2605.29642,
title = {Matching Rates and Optimal Allocation for Federated Probe-Logit Distillation under Heterogeneous Bandwidth Budgets},
author = {Prasanjit Dubey and Xiaoming Huo},
journal= {arXiv preprint arXiv:2605.29642},
year = {2026}
}