基于随机傅里叶特征的采样 Softmax
机器学习
2020-01-01 v2 机器学习
摘要
使用 softmax 交叉熵损失进行训练的计算代价随类别数量线性增长。在涉及大量类别的场景中,一种常见的加速训练方法是采样类别子集,并利用基于这些类别的损失梯度估计,即所谓的采样 softmax 方法。然而,除非样本从精确的 softmax 分布中抽取(而该分布的计算同样代价高昂),否则采样 softmax 提供的梯度估计是有偏的。因此,一种被广泛采用的实用方法是从一个更简单的分布中采样,以期近似精确的 softmax 分布。本文中,我们首次从理论层面理解了不同采样分布在决定采样 softmax 质量中的作用。受我们的分析以及基于核的采样工作的启发,我们提出了随机傅里叶 Softmax(RF-softmax)方法,该方法利用强大的随机傅里叶特征(Random Fourier Features)来实现从近似 softmax 分布中更高效且更准确的采样。我们表明,RF-softmax 在完整 softmax 分布和完整 softmax 梯度两方面均导致较低的估计偏差。此外,RF-softmax 的代价仅随类别数量对数级增长。
引用
@article{arxiv.1907.10747,
title = {Sampled Softmax with Random Fourier Features},
author = {Ankit Singh Rawat and Jiecao Chen and Felix Yu and Ananda Theertha Suresh and Sanjiv Kumar},
journal= {arXiv preprint arXiv:1907.10747},
year = {2020}
}
备注
In NeurIPS 2019