中文

TF-IDF 与词嵌入在临床笔记发病率识别中的比较:一项初步研究

计算与语言 2021-06-10 v2 机器学习

摘要

如今,我们看到包含临床结果、图像及患者健康状态文本描述临床笔记的数量不断增加。所有这些数据均可被分析并用于提供新颖服务,以协助人们与领域专家完成常规医疗任务。然而,诸如深度学习与词嵌入(Word Embeddings)等许多技术近期才开始被研究,在医疗领域应用中诸多挑战仍待解决。为应对这些挑战,我们提出使用深度学习与词嵌入来识别临床记录文本描述中的十六种发病率类型。为此,我们采用了基于双向长短期记忆(LSTM)层的深度学习模型,其可利用如词嵌入等最先进的数据向量表示。我们采用了预训练词嵌入 GloVe 与 Word2Vec,以及在目标域上训练的自有词嵌入。此外,我们将深度学习方法与传统 tf-idf 结合支持向量机与多层感知机(我们的基线)的性能进行比较。所得结果显示,后者优于使用任意词嵌入的深度学习组合。我们的初步结果表明,存在特定特征使数据集偏向传统机器学习方法。

关键词

引用

@article{arxiv.2105.09632,
  title  = {TF-IDF vs Word Embeddings for Morbidity Identification in Clinical Notes: An Initial Study},
  author = {Danilo Dessi and Rim Helaoui and Vivek Kumar and Diego Reforgiato Recupero and Daniele Riboni},
  journal= {arXiv preprint arXiv:2105.09632},
  year   = {2021}
}

备注

12 pages, 2 figures, 2 tables, SmartPhil 2020-First Workshop on Smart Personal Health Interfaces, Associated to ACM IUI 2020