一种用于医学术语缩写消歧的神经主题注意力模型
计算与语言
2019-11-01 v1
摘要
临床记录的自动化分析正吸引越来越多的关注。然而,关于医学术语缩写消歧的工作尚不多见。此类缩写在临床文档中大量存在且高度歧义。主要障碍之一是缺乏大规模、均衡的标注数据集。为解决该问题,我们提出一种少样本学习方法以利用有限的标注数据。具体而言,应用一种神经主题注意力模型来学习改进的上下文句子表示,用于医学术语缩写消歧。另一关键问题是现有稀缺标注含有噪声且不完整。我们重新检查并修正了一个现有数据集用于训练,并收集了一个测试集以公平评估模型,尤其针对罕见义项。我们在包含 30 个缩写术语作为类别(每个术语平均 479 个样本、3.24 个类)的训练集上训练模型,该训练集选自一个公开缩写消歧数据集,随后在一个人工创建的均衡数据集(每个术语每个类含 15 个样本)上测试。我们表明,与多个基线模型相比,用主题信息增强句子表示在小型非均衡训练数据集上大幅提升了性能。
引用
@article{arxiv.1910.14076,
title = {A Neural Topic-Attention Model for Medical Term Abbreviation Disambiguation},
author = {Irene Li and Michihiro Yasunaga and Muhammed Yavuz Nuzumlalı and Cesar Caraballo and Shiwani Mahajan and Harlan Krumholz and Dragomir Radev},
journal= {arXiv preprint arXiv:1910.14076},
year = {2019}
}