利用预训练序列到序列模型从医院病程记录中总结患者问题
计算与语言
2022-09-16 v2 人工智能
摘要
利用自然语言处理方法自动从每日病程记录中总结患者主要问题,有助于应对医院环境中的信息与认知过载,并潜在辅助提供者的计算机化诊断决策支持。问题列表总结要求模型理解、抽象并生成临床文档。本工作中,我们提出一项新的 NLP 任务,旨在利用患者住院期间提供者的病程记录作为输入,生成其每日护理计划中的问题列表。我们考察了 T5 与 BART 这两个最先进的 seq2seq transformer 架构在解决该问题上的表现。我们基于公开电子健康记录病程记录 Medical Information Mart for Intensive Care (MIMIC)-III 构建了语料。T5 与 BART 在通用领域文本上预训练,我们尝试了数据增强方法与领域自适应预训练方法以增加对医学词汇与知识的接触。评估方法包括 ROUGE、BERTScore、句向量余弦相似度及医学概念 F-score。结果显示,经领域自适应预训练的 T5 相较基于规则系统与通用领域预训练语言模型取得显著性能提升,表明这是解决该问题总结任务的有前景方向。
引用
@article{arxiv.2208.08408,
title = {Summarizing Patients Problems from Hospital Progress Notes Using Pre-trained Sequence-to-Sequence Models},
author = {Yanjun Gao and Dmitriy Dligach and Timothy Miller and Dongfang Xu and Matthew M. Churpek and Majid Afshar},
journal= {arXiv preprint arXiv:2208.08408},
year = {2022}
}
备注
Paper is accepted to COLING 2022