中文

无训练数据训练:提升自动化医学缩写消歧的泛化能力

机器学习 2019-12-16 v1 计算与语言 机器学习

摘要

由于临床环境中缩写使用频繁,缩写消歧对自动化临床笔记处理十分重要。当前自动化缩写消歧模型受限于标记训练数据的稀缺与不平衡,降低了对正交来源的泛化能力。本工作中我们提出一种利用相关医学概念信息的新颖数据增强技术,提升了模型的泛化能力。此外,我们表明纳入整份医学笔记中的全局上下文信息(除传统的局部上下文窗口外)可显著改进模型对缩写的表征。我们在公共数据集(MIMIC III)上训练模型,并在不同来源的数据集(CASI、i2b2)上测试性能。综上,这两种技术使 CASI 数据集上缩写消歧准确率提升近 14%,i2b2 上提升 4%。

关键词

引用

@article{arxiv.1912.06174,
  title  = {Training without training data: Improving the generalizability of automated medical abbreviation disambiguation},
  author = {Marta Skreta and Aryan Arbabi and Jixuan Wang and Michael Brudno},
  journal= {arXiv preprint arXiv:1912.06174},
  year   = {2019}
}

备注

NeurIPS Machine Learning for Healthcare 2019 Conference Proceedings