AWE-CM 向量:以临床元词表增强词嵌入
计算与语言
2017-12-06 v1
摘要
近年来,词嵌入在捕捉其所表示词语的直观特征方面出奇地有效。这些向量在训练语料极庞大(有时达数十亿词)时取得最佳结果。然而,临床自然语言处理数据集往往小得多。即便最大的公开可用医学记录数据集,也比常用的“Google News”词向量数据集小三个数量级。为弥补训练数据规模有限,我们将专家领域知识编码进嵌入中。在先前 word2vec 扩展的基础上,我们表明将词语“上下文”的概念推广到包含任意特征,为将领域知识编码进词嵌入开辟了途径。我们表明,该方法产生的词向量在与临床专家相关性方面全面优于仅基于文本的对应向量。
引用
@article{arxiv.1712.01460,
title = {AWE-CM Vectors: Augmenting Word Embeddings with a Clinical Metathesaurus},
author = {Willie Boag and Hassan Kané},
journal= {arXiv preprint arXiv:1712.01460},
year = {2017}
}