中文

语料库复现任务

机器学习 2018-06-22 v1 计算与语言 机器学习

摘要

在自然语言处理(NLP)领域,我们重新审视著名的词嵌入算法 word2vec。词嵌入以向量标识词语,从而捕捉词语的分布相似性。出乎意料的是,除语义相似性外,word2vec 生成的词嵌入甚至能捕捉关系相似性,由此引出两个问题:其一,何种关系可在连续空间中表示;其二,关系是如何构建的。为应对这些问题,我们提出一种自底向上的视角。我们将“生成使 word2vec 输出目标关系的输入文本”称为求解语料库复现任务(Corpus Replication Task)。鉴于该方法可推广至任意关系集合,我们期望通过求解语料库复现任务来为上述问题提供部分解答。

关键词

引用

@article{arxiv.1806.07978,
  title  = {The Corpus Replication Task},
  author = {Tobias Eichinger},
  journal= {arXiv preprint arXiv:1806.07978},
  year   = {2018}
}

备注

the references might not render appropriately. contact the author for details