CoVeR:利用张量分解学习协变量特定向量表示
计算与语言
2018-07-10 v2
摘要
词嵌入是捕捉大型文本语料库中共现结构的有用方法。然而,除文本数据本身外,我们常拥有与单个语料文档相关联的额外协变量——例如作者的 demographics、发表时间与场所——并希望嵌入自然捕捉此信息。我们提出 CoVeR,一种用于带协变量向量嵌入的新张量分解模型。CoVeR 联合学习所有词的基嵌入以及加权对角矩阵来建模每个协变量如何影响基嵌入。例如,要获得作者或场所特定的嵌入,我们随后可简单将基嵌入乘以关联变换矩阵。我们方法的主要优势是数据效率与协变量变换的可解释性。我们的实验表明,相较于仅使用相关数据子集为每个协变量学习独立嵌入的标准方法以及其他相关方法,我们的联合模型学到显著更好的协变量特定嵌入。此外,CoVeR 鼓励嵌入“主题对齐”,即维度具有特定独立含义。这使得我们的协变量特定嵌入可按主题比较,实现下游差异分析。我们在数据集上实证评估算法的益处,并展示其如何用于解答许多关于协变量效应的自然问题。本文配套代码见 http://github.com/kjtian/CoVeR。
引用
@article{arxiv.1802.07839,
title = {CoVeR: Learning Covariate-Specific Vector Representations with Tensor Decompositions},
author = {Kevin Tian and Teng Zhang and James Zou},
journal= {arXiv preprint arXiv:1802.07839},
year = {2018}
}
备注
12 pages. Appears in ICML 2018