在言语尸检分析中利用语言模型与机器学习
计算与语言
2025-08-28 v1
摘要
在没有民事登记和生命统计的国家,言语尸检(Verbal Autopsy, VA)是估计死因(Cause of Death, COD)和为政策优先级提供信息的重要工具。在 VA 中,访谈员以非结构化叙述和结构化问题的形式,向近亲知情人询问死者生前情况的细节。现有的自动化 VA 死因分类算法仅使用问题而忽略了叙述中的信息。在本论文中,我们研究了如何使用预训练语言模型(Pretrained Language Models, PLM)和机器学习(Machine Learning, ML)技术将 VA 叙述用于自动化 COD 分类。使用来自南非的实证数据,我们证明仅凭叙述,基于 Transformer 的 PLM 在任务特定微调后,在个体和群体两个层面上均优于仅依赖问题的领先算法,特别是在识别非传染性疾病方面。我们探索了在统一框架中结合叙述和问题的各种多模态融合策略。多模态方法进一步提升了 COD 分类的性能,证实了每种模态都有独特的贡献,可能捕获另一种模态中不存在的有价值信息。我们还表征了医生在 VA 中感知的信息充分性。我们描述了充分性水平随年龄和 COD 的变化,并证明医生和模型的分类准确性均受充分性影响。总体而言,本论文推进了自然语言处理、流行病学和全球健康交叉领域日益增长的知识体系。它展示了叙述在增强 COD 分类中的价值。我们的发现强调,需要来自更多样化环境的更高质量数据,用于训练和微调 PLM/ML 方法,并为重新思考和重新设计 VA 工具及访谈提供有价值的见解。
引用
@article{arxiv.2508.19274,
title = {Leveraging Language Models and Machine Learning in Verbal Autopsy Analysis},
author = {Yue Chu},
journal= {arXiv preprint arXiv:2508.19274},
year = {2025}
}
备注
Ph.D. dissertation submitted to The Ohio State University, August 2025