中文

用于对数线性模型配分函数计算的一类新的无偏高效基于 LSH 的采样器与估计器

机器学习 2017-03-16 v1 数据库 数据结构与算法 机器学习

摘要

对数线性模型可以说是大规模应用中最成功的一类图模型,因为它们简单且易于处理。这些模型的学习与推断需要计算配分函数,这是一个主要瓶颈,且对于大状态空间而言难以处理。重要性采样和基于 MCMC 的方法颇具吸引力。然而,在实践中,拥有一个“好”提议分布的条件通常无法满足。在本文中,我们为通过采样进行高效估计增加了一个新维度。我们提出了一种新的采样方案和一个无偏估计器,能够在亚线性时间内准确估计配分函数。我们的样本使用局部敏感哈希(LSH)在近常数时间内生成,因此是相关且未归一化的。我们通过将估计配分函数的准确性与速度与其他最先进的估计技术(包括 IS 和 Gumbel-Max 采样的高效变体)进行比较,展示了所提方法的有效性。借助我们高效的采样方案,我们仅使用 1-2% 的计算量便准确训练了真实世界的语言模型。

关键词

引用

@article{arxiv.1703.05160,
  title  = {A New Unbiased and Efficient Class of LSH-Based Samplers and Estimators for Partition Function Computation in Log-Linear Models},
  author = {Ryan Spring and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:1703.05160},
  year   = {2017}
}