通过 Gram 矩阵估计在超大语料库上的高效训练
机器学习
2018-07-20 v1 计算与语言
机器学习
摘要
我们研究使用神经网络嵌入模型在超大语料库上学习相似度函数的问题。这些模型通常使用 SGD 对随机观测和未观测样本对进行采样来训练,样本数量随语料库大小呈二次增长,使其难以扩展到超大语料库。我们提出了无需采样未观测样本对即可高效训练这些模型的新方法。受矩阵分解启发,我们的方法依赖于对所有样本对添加全局二次惩罚,并将该项表示为两个广义 Gram 矩阵(Gramian)的矩阵内积。我们证明该项的梯度可通过维护 Gram 矩阵的估计来高效计算,并开发了方差缩减方案以提升估计质量。我们开展的大规模实验表明,与传统采样方法相比,训练时间和泛化质量均有显著改善。
引用
@article{arxiv.1807.07187,
title = {Efficient Training on Very Large Corpora via Gramian Estimation},
author = {Walid Krichene and Nicolas Mayoraz and Steffen Rendle and Li Zhang and Xinyang Yi and Lichan Hong and Ed Chi and John Anderson},
journal= {arXiv preprint arXiv:1807.07187},
year = {2018}
}