改进口头尸检报告中的死因分类
计算与语言
2022-11-01 v1 机器学习
摘要
在包括南非在内的许多中低收入国家,由于患者隐私和保密政策,卫生机构的数据访问受到限制。此外,由于临床数据对各个机构和实验室具有独特性,缺乏足够的数据标注标准和规范。由于文本数据的稀缺,自然语言处理(NLP)技术在卫生部门表现不佳。在没有可靠死亡登记系统的地方,死因(COD)通常由口头尸检(VA)报告确定。非临床现场工作人员使用一组标准化问题作为指导来进行VA报告,以揭示COD的症状。本分析以VA报告的文本部分作为案例研究,解决在卫生领域适配NLP技术的挑战。我们提出一个系统,依赖单语学习和多源域适应两种迁移学习范式,以改进针对COD分类目标任务的VA叙述文本。我们使用在通用英语和健康领域预训练的来自Transformer的双向编码器表示(BERT)和来自语言模型的嵌入(ELMo)模型从VA叙述文本中提取特征。我们的研究结果表明,该迁移学习系统改进了COD分类任务,且叙述文本包含用于推断COD的有价值信息。我们的结果进一步表明,通过此框架学习的二元VA特征与叙述文本特征相结合可提升COD分类任务。
引用
@article{arxiv.2210.17161,
title = {Improving Cause-of-Death Classification from Verbal Autopsy Reports},
author = {Thokozile Manaka and Terence van Zyl and Deepak Kar},
journal= {arXiv preprint arXiv:2210.17161},
year = {2022}
}
备注
Southern African Conference for Artificial Intelligence Research