中文

作为统计估计量的词嵌入

统计方法学 2023-01-18 v1

摘要

词嵌入是自然语言处理中的基础工具。当前,词嵌入方法的评估基于基准数据集上的经验性能,缺乏对其理论性质的严格理解。本文从统计理论视角研究词嵌入,这对形式化推断与不确定性量化至关重要。我们提出一个基于 copula 的文本数据统计模型,并表明在该模型下,如今经典的 Word2Vec 方法可解释为用于估计理论逐点互信息(PMI)的统计估计方法。接着,基于 Levy 与 Goldberg(2014)的工作,我们发展了一种基于缺失值的估计量,作为统计上易处理且可解释的 Word2Vec 方法替代方案。该估计量的估计误差与 Word2Vec 相当,并改进了 Levy 与 Goldberg(2014)提出的基于截断的方法。所提估计量在 IMDb 影评数据集的基准情感分析任务中也表现与 Word2Vec 相当。

关键词

引用

@article{arxiv.2301.06710,
  title  = {Word Embeddings as Statistical Estimators},
  author = {Neil Dey and Matthew Singer and Jonathan P. Williams and Srijan Sengupta},
  journal= {arXiv preprint arXiv:2301.06710},
  year   = {2023}
}