基于问答的全面中文电子健康记录信息抽取流水线
计算与语言
2024-02-20 v1 信息检索
摘要
电子健康记录 (EHR) 对研究和应用具有重要价值。作为一种新的信息抽取方式,问答 (QA) 能够比传统方法抽取更灵活的信息,且对临床研究人员更易于使用,但其进展受限于标注数据的稀缺。在本文中,我们提出了一种新方法,可自动生成训练数据用于 QA 模型的迁移学习。我们的流水线包含一个预处理模块,以处理那些不易与抽取式 QA 框架兼容的抽取类型所带来的挑战,包括答案不连续和一对多关系的情况。获得的 QA 模型在 EHR 信息抽取的子任务上表现出优异的性能,并且能够有效处理涉及是非问题的 few-shot 或 zero-shot 设定。案例研究和消融研究证明了我们设计中每个组件的必要性,并且由此产生的模型被认为适合实际使用。
引用
@article{arxiv.2402.11177,
title = {A Question Answering Based Pipeline for Comprehensive Chinese EHR Information Extraction},
author = {Huaiyuan Ying and Sheng Yu},
journal= {arXiv preprint arXiv:2402.11177},
year = {2024}
}