中文

基于均值-KL 参数化的极小随机码学习

机器学习 2023-12-05 v2 机器学习

摘要

本文研究了用于压缩变分贝叶斯神经网络的两种极小随机码学习(MIRACLE)变体的定性行为与鲁棒性。MIRACLE 对权重后验 QwQ_{\mathbf{w}} 实现了一种强大的条件高斯变分近似,并使用相对熵编码借助高斯编码分布 PwP_{\mathbf{w}} 来压缩来自后验的权重样本。为达到期望的压缩率,必须约束 DKL[QwPw]D_{\mathrm{KL}}[Q_{\mathbf{w}} \Vert P_{\mathbf{w}}],这在 QwQ_{\mathbf{w}} 常规的均值-方差(Mean-Var)参数化下需要计算昂贵的退火过程。相反,我们用其均值及相对于 PwP_{\mathbf{w}} 的 KL 散度来参数化 QwQ_{\mathbf{w}},从而按构造将压缩代价约束到期望值。我们证明,采用均值-KL 参数化的变分训练收敛速度加倍,且在压缩后保持预测性能。此外,我们表明均值-KL 带来了更具意义的变分分布,其具有更重的尾部和更鲁棒于剪枝的压缩权重样本。

关键词

引用

@article{arxiv.2307.07816,
  title  = {Minimal Random Code Learning with Mean-KL Parameterization},
  author = {Jihao Andreas Lin and Gergely Flamich and José Miguel Hernández-Lobato},
  journal= {arXiv preprint arXiv:2307.07816},
  year   = {2023}
}

备注

ICML Neural Compression Workshop 2023