两种高效且信息丰富的负采样分布
机器学习
2021-07-30 v2 人工智能
数据结构与算法
信息检索
摘要
具有极多类别数的 softmax 分类器自然出现在许多应用中,例如自然语言处理和信息检索。从计算和能耗角度看,完整 softmax 的计算代价高昂。已有多种采样方法克服这一挑战,即广为所知的负采样(NS)。理想情况下,NS 应从依赖于输入数据、当前参数和正确正类的分布中采样负类。遗憾的是,由于参数和数据样本的动态更新,尚无被证明具有自适应性且能高效采样负类的方案。因此,人们采用了随机采样、基于静态频率的采样或基于学习的偏置采样等替代启发式方法,它们主要权衡每次迭代的采样代价或样本自适应性。本文中,我们展示了两类分布,其采样方案真正自适应且可证明在近常数时间内生成负样本。我们在 CPU 上用 C++ 的实现,相较于在强大 NVIDIA V100 GPU 上其他流行负采样方法最优化的 TensorFlow 实现,无论在挂钟时间还是精度上都显著占优。
引用
@article{arxiv.2012.15843,
title = {A Tale of Two Efficient and Informative Negative Sampling Distributions},
author = {Shabnam Daghaghi and Tharun Medini and Nicholas Meisburger and Beidi Chen and Mengnan Zhao and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:2012.15843},
year = {2021}
}
备注
Published at ICML 2021