单样本二值梯度估计器中的偏差-方差权衡
机器学习
2021-10-18 v2 神经与进化计算
摘要
离散尤其是二值随机变量出现在许多机器学习模型中,特别是在具有二值潜状态的变分自编码器和随机二值网络中。在学习此类模型时,一个关键工具是针对二值变量概率的期望损失梯度的估计器。直通(ST)估计器因其简单性和高效性而受到欢迎,特别是在无偏估计器不实用的深度网络中。人们提出了几种技术以在保持相同低计算复杂度的同时改进ST:Gumbel-Softmax、ST-Gumbel-Softmax、BayesBiNN、FouST。我们对这些方法的偏差和方差进行理论分析,以理解权衡并验证最初声称的性质。所提出的理论结果有助于更好地理解这些方法,并在某些情况下揭示了严重问题。
引用
@article{arxiv.2110.03549,
title = {Bias-Variance Tradeoffs in Single-Sample Binary Gradient Estimators},
author = {Alexander Shekhovtsov},
journal= {arXiv preprint arXiv:2110.03549},
year = {2021}
}
备注
22 pages, GCPR 2021