基于长短期记忆节点的词嵌入与循环神经网络在监督式生物医学词义消歧中的应用
计算与语言
2016-12-20 v3 机器学习
摘要
词义消歧有助于识别文本中歧义词的正确词义。对于诸如 UMLS Metathesaurus 这样的大型术语库,会出现歧义,因此需要高效的消歧方法。监督学习算法方法被用作执行消歧的方法之一。从歧义词的上下文中提取的特征被用于识别该词的正确词义。特征的类型对机器学习方法有影响,从而影响消歧性能。在这项工作中,我们评估了源自歧义词上下文的若干类型特征,并且我们还探索了使用词嵌入从 MEDLINE 派生的更全局的特征。结果表明,词嵌入提升了更传统特征的性能,并且也允许使用基于长短期记忆(Long-Short Term Memory, LSTM)节点的循环神经网络分类器。在 MSH WSD 数据集上,unigrams 与词嵌入结合 SVM 以 95.97 的宏准确率创造了新的最优性能。
引用
@article{arxiv.1604.02506,
title = {Word embeddings and recurrent neural networks based on Long-Short Term Memory nodes in supervised biomedical word sense disambiguation},
author = {Antonio Jimeno Yepes},
journal= {arXiv preprint arXiv:1604.02506},
year = {2016}
}