中文

由词之所伴及邻近者而知

计算与语言 2022-05-03 v1 信息论 math.IT 数据分析、统计与概率 机器学习

摘要

最先进(SOTA)的自然语言处理(NLP)系统的发展稳步建立了吸收语言数据统计量的新技术。这些技术常可追溯到传统理论中的著名构造,我们研究这些联系以弥合关键 NLP 方法周围的鸿沟,并以此作为指引未来工作的手段。为此,我们引入一个分析模型,用于刻画标志性算法(包括 GloVe 和 Word2Vec)所学到的统计量,并推导出对使用这些算法及共现统计量之系统的见解。在本工作中,我们推导出了——据我们所知——Word2Vec 的 softmax 优化跳字算法首个已知解。该结果作为深度学习(DL)语言模型(LM)矩阵分解的直接解,展现出令人振奋的未来发展潜力。然而,我们利用该解证明了词向量所展现且允许在 DL 模型吸收数据之前对数据中偏差进行预防性辨识的一种看似普遍存在的属性。为佐证我们的工作,我们对独立性进行了分析,即共现模型中统计依赖的密度,这进而对分布假说被共现统计部分满足提供了见解。

关键词

引用

@article{arxiv.2205.00148,
  title  = {To Know by the Company Words Keep and What Else Lies in the Vicinity},
  author = {Jake Ryland Williams and Hunter Scott Heidenreich},
  journal= {arXiv preprint arXiv:2205.00148},
  year   = {2022}
}