中文

两种高效且信息丰富的负采样分布

机器学习 2021-07-30 v2 人工智能 数据结构与算法 信息检索

摘要

具有极多类别数的 softmax 分类器自然出现在许多应用中,例如自然语言处理和信息检索。从计算和能耗角度看,完整 softmax 的计算代价高昂。已有多种采样方法克服这一挑战,即广为所知的负采样(NS)。理想情况下,NS 应从依赖于输入数据、当前参数和正确正类的分布中采样负类。遗憾的是,由于参数和数据样本的动态更新,尚无被证明具有自适应性且能高效采样负类的方案。因此,人们采用了随机采样、基于静态频率的采样或基于学习的偏置采样等替代启发式方法,它们主要权衡每次迭代的采样代价或样本自适应性。本文中,我们展示了两类分布,其采样方案真正自适应且可证明在近常数时间内生成负样本。我们在 CPU 上用 C++ 的实现,相较于在强大 NVIDIA V100 GPU 上其他流行负采样方法最优化的 TensorFlow 实现,无论在挂钟时间还是精度上都显著占优。

关键词

引用

@article{arxiv.2012.15843,
  title  = {A Tale of Two Efficient and Informative Negative Sampling Distributions},
  author = {Shabnam Daghaghi and Tharun Medini and Nicholas Meisburger and Beidi Chen and Mengnan Zhao and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:2012.15843},
  year   = {2021}
}

备注

Published at ICML 2021