中文

纵观全貌:利用多标签医学文本分类技术提升医学编码预测

信息检索 2020-04-02 v1 机器学习 机器学习

摘要

基于机器学习的多标签医学文本分类可用于增强对人体理解并辅助患者照护需求。我们提出了一项关于临床自然语言处理技术的广泛研究,以在多病患者预测医学编码时最大化表示文本的特征。我们给出了具有 18、50 和 155 个标签的多标签医学文本分类问题的结果。我们比较了嵌入、文本标注和预处理的若干变体。对于不平衡数据,我们表明出现频率低的标签从嵌入中融入的附加特征中获益最多。我们还表明,使用健康相关数据预训练的高维嵌入在多标签设定下呈现显著改进,类似于其在二分类中提升性能的方式。本研究的高维嵌入已公开供公众使用。

关键词

引用

@article{arxiv.2004.00430,
  title  = {Seeing The Whole Patient: Using Multi-Label Medical Text Classification Techniques to Enhance Predictions of Medical Codes},
  author = {Vithya Yogarajan and Jacob Montiel and Tony Smith and Bernhard Pfahringer},
  journal= {arXiv preprint arXiv:2004.00430},
  year   = {2020}
}