中文

一种无需对齐的改进历史词嵌入方法

计算与语言 2019-10-22 v1 信息检索

摘要

许多词语因文化和社会变迁而发生了意义演变。理解此类变化对于建模语言和文化演化至关重要。低维嵌入方法已展现出通过将这些词编码为稠密向量来检测词义变化的潜力。然而,在探索词随时间推移的语义变化时,这些方法需要对不同时间段的词嵌入进行对齐。该过程计算代价高昂、极其耗时且受上下文变异性影响。本文提出一种新颖且可扩展的方法,将不同时间段的词编码到同一个稠密向量空间中。这在识别随时间发生意义变化的词时,可大幅提升性能。我们在Google Books N-gram数据集上评估了该方法。在正确识别出的意义变化词数量方面,我们的方法优于其他三种流行方法。此外,我们提供了由该方法提取的部分词语语义演化的直观可视化。

关键词

引用

@article{arxiv.1910.08692,
  title  = {An Improved Historical Embedding without Alignment},
  author = {Xiaofei Xu and Ke Deng and Fei Hu and Li Li},
  journal= {arXiv preprint arXiv:1910.08692},
  year   = {2019}
}

备注

9 pages, 5 figures, conference