语料库复现任务
机器学习
2018-06-22 v1 计算与语言
机器学习
摘要
在自然语言处理(NLP)领域,我们重新审视著名的词嵌入算法 word2vec。词嵌入以向量标识词语,从而捕捉词语的分布相似性。出乎意料的是,除语义相似性外,word2vec 生成的词嵌入甚至能捕捉关系相似性,由此引出两个问题:其一,何种关系可在连续空间中表示;其二,关系是如何构建的。为应对这些问题,我们提出一种自底向上的视角。我们将“生成使 word2vec 输出目标关系的输入文本”称为求解语料库复现任务(Corpus Replication Task)。鉴于该方法可推广至任意关系集合,我们期望通过求解语料库复现任务来为上述问题提供部分解答。
引用
@article{arxiv.1806.07978,
title = {The Corpus Replication Task},
author = {Tobias Eichinger},
journal= {arXiv preprint arXiv:1806.07978},
year = {2018}
}
备注
the references might not render appropriately. contact the author for details