中文

用于临床 ICD 编码的时间性文档序列建模

机器学习 2023-02-27 v1 人工智能 计算与语言

摘要

既往关于 ICD 编码问题的研究聚焦于主要依据出院小结预测临床编码。这仅覆盖每次住院期间所生成笔记的一小部分,并通过分析所有可用临床笔记留有提升性能的潜力。我们提出一种分层 transformer 架构,利用每次住院整个临床笔记序列的文本进行 ICD 编码,并融入文本元数据(如位置、时间与笔记类型)的嵌入。尽管使用全部临床笔记大幅增加了数据量,超收敛可用于降低训练成本。我们在 MIMIC-III 数据集上评估该模型。当仅以出院小结为输入时,我们的模型超越先前最优;当以全部临床笔记为输入时取得进一步性能提升。

关键词

引用

@article{arxiv.2302.12666,
  title  = {Modelling Temporal Document Sequences for Clinical ICD Coding},
  author = {Clarence Boon Liang Ng and Diogo Santos and Marek Rei},
  journal= {arXiv preprint arXiv:2302.12666},
  year   = {2023}
}