上下文编码器:word2vec 的简单而强大的扩展
机器学习
2017-06-09 v1 计算与语言
机器学习
摘要
word2vec 凭借其简单的架构和从包含数十亿词的文本中高效学习有意义词嵌入的能力,至今仍是最流行的神经语言模型之一。然而,由于词汇表中的每个词仅学习一个嵌入,该模型无法最优地表示多义词。此外,它也无法即时为新词(词汇表外词)创建嵌入。基于对连续词袋(CBOW)word2vec 模型负采样训练目标在预测上下文相似度方面的直观解释,我们提出了一种模型扩展,称为上下文编码器(ConEc)。通过将训练好的 word2vec 嵌入矩阵与一个词的平均上下文向量相乘,可以基于该词的局部上下文为词汇表外(OOV)词和多义词创建嵌入和表示。通过在 CoNLL 2003 命名实体识别(NER)任务中使用这些词嵌入作为特征,展示了该方法的优势。
引用
@article{arxiv.1706.02496,
title = {Context encoders as a simple but powerful extension of word2vec},
author = {Franziska Horn},
journal= {arXiv preprint arXiv:1706.02496},
year = {2017}
}
备注
ACL 2017 2nd Workshop on Representation Learning for NLP