医学文本中命名实体识别的少样本学习
计算与语言
2018-11-15 v1 机器学习
机器学习
摘要
深度神经网络模型近来在多种自然语言处理(NLP)任务中取得了最先进的性能提升(Young, Hazarika, Poria, & Cambria, 2017)。然而,这些提升依赖于大量标注样本的可用性,若无此类样本,则很少能达到最先进的性能。这对于许多标注样本稀缺的 NLP 领域尤为不便,例如医学文本。为改善此种情形下的 NLP 模型,我们评估了在仅提供十个标注样本时命名实体识别(NER)任务上的五项改进:(1)使用预训练权重进行逐层初始化,(2)超参数调优,(3)合并预训练数据,(4)自定义词嵌入,以及(5)优化词表外(OOV)词。实验结果表明,最先进模型可获得的 69.3% 的 F1 分数可被提升至 78.87%。
引用
@article{arxiv.1811.05468,
title = {Few-shot Learning for Named Entity Recognition in Medical Text},
author = {Maximilian Hofer and Andrey Kormilitzin and Paul Goldberg and Alejo Nevado-Holgado},
journal= {arXiv preprint arXiv:1811.05468},
year = {2018}
}
备注
10 pages, 4 figures, 4 tables