公共卫生信息学:基于神经机器翻译的死亡因果序列推断
摘要
全球每年有近 5700 万人死亡,其中美国超过 270 万人。及时、准确和完整的死亡报告在公共卫生中至关重要,因为机构和政府机构依赖死亡报告来分析生命统计并制定针对传染病的应对措施。不准确的死亡报告可能导致公共卫生政策的潜在误导。然而,即使对经验丰富的医生而言,确定死因也具有挑战性。为协助医生准确报告死因,我们提出了一种先进的 AI 方法,基于死者最后一次医院出院记录,确定导致死亡的按时间顺序排列的临床状况序列。死亡报告上的临床代码序列被称为死亡因果链,采用国际疾病分类第十次修订版(ICD-10)编码;根据 ICD-9-CM 编码与报告官方指南,出院记录上按优先级排序的临床状况采用 ICD-9 编码。我们识别出推断死亡因果链的三个挑战:临床代码的两套编码系统、医学领域知识冲突以及数据互操作性。为克服该序列到序列问题中的第一个挑战,我们应用神经机器翻译模型生成目标序列。结合三项准确性指标,我们使用 BLEU(BiLingual Evaluation Understudy,双语评估替补)分数评估生成序列的质量,获得了 100 分中的 16.04 分。针对第二个挑战,我们将专家验证的医学领域知识作为约束纳入输出序列的生成过程,以排除不可行的因果链。最后,我们在 Fast Healthcare Interoperability Resources(FHIR,快速医疗互操作性资源)接口中展示了我们工作的可用性,以应对第三个挑战。
引用
@article{arxiv.2009.10318,
title = {Public Health Informatics: Proposing Causal Sequence of Death Using Neural Machine Translation},
author = {Yuanda Zhu and Ying Sha and Hang Wu and Mai Li and Ryan A. Hoffman and May D. Wang},
journal= {arXiv preprint arXiv:2009.10318},
year = {2021}
}
备注
11 pages, 8 figures, 8 tables. Updates: (1) Added Section II: Recent Work (2) Added three accuracy evaluation criteria (3) Re-run experiments of OpenNMT and updated the results and discussion in Section VI: Results and Discussion (4) Finished FHIR mobile app and updated Section VII: FHIR Interface (5) Revised Section VIII: Conclusion accordingly