中文

基于形态学扩展的小数据集无监督词嵌入增强

计算与语言 2017-11-16 v1

摘要

我们提出一种与语言无关的无监督方法,利用文本的形态学扩展来构建词嵌入。我们的模型通过在对人工生成的句子训练词嵌入来处理数据稀疏问题,并产生改进的词嵌入。我们使用七种语言上用于词相似度任务的十一个测试集,以小规模训练集评估了我们的方法。此外,对于英语,我们使用大型训练集在三个标准测试集上评估了方法的影响。我们的方法在所有语言上均改进了结果。

关键词

引用

@article{arxiv.1711.05678,
  title  = {Unsupervised Morphological Expansion of Small Datasets for Improving Word Embeddings},
  author = {Syed Sarfaraz Akhtar and Arihant Gupta and Avijit Vajpayee and Arjit Srivastava and Manish Shrivastava},
  journal= {arXiv preprint arXiv:1711.05678},
  year   = {2017}
}

备注

CICLing 2017