无训练数据训练:提升自动化医学缩写消歧的泛化能力
机器学习
2019-12-16 v1 计算与语言
机器学习
摘要
由于临床环境中缩写使用频繁,缩写消歧对自动化临床笔记处理十分重要。当前自动化缩写消歧模型受限于标记训练数据的稀缺与不平衡,降低了对正交来源的泛化能力。本工作中我们提出一种利用相关医学概念信息的新颖数据增强技术,提升了模型的泛化能力。此外,我们表明纳入整份医学笔记中的全局上下文信息(除传统的局部上下文窗口外)可显著改进模型对缩写的表征。我们在公共数据集(MIMIC III)上训练模型,并在不同来源的数据集(CASI、i2b2)上测试性能。综上,这两种技术使 CASI 数据集上缩写消歧准确率提升近 14%,i2b2 上提升 4%。
引用
@article{arxiv.1912.06174,
title = {Training without training data: Improving the generalizability of automated medical abbreviation disambiguation},
author = {Marta Skreta and Aryan Arbabi and Jixuan Wang and Michael Brudno},
journal= {arXiv preprint arXiv:1912.06174},
year = {2019}
}
备注
NeurIPS Machine Learning for Healthcare 2019 Conference Proceedings