中文

临床叙述中健康社会决定因素抽取的任务构建

计算与语言 2023-01-30 v1

摘要

目的:2022 年 n2c2 NLP 挑战赛提出了在临床叙述中识别健康社会决定因素(SDOH)的任务。我们展示了为该挑战赛开发的三个系统,并讨论三个系统各自使用的独特任务构建方式。材料与方法:第一个系统使用机器学习分类器独立识别目标信息片段。第二个系统使用大语言模型(LLM)抽取每篇文档的完整结构化输出。第三个系统使用机器学习抽取候选短语,并以手工规则识别目标关系。结果:三个系统在挑战赛子任务 A 中分别取得了 0.884、0.831 和 0.663 的 F1 分数,在 15 支参赛队伍中分别排名第三、第七和第八。对我们系统抽取结果的审查揭示了各方法的特点以及 SODH 抽取任务的特点。讨论:任务中标注的短语和关系独特且多样,不符合常规的事件抽取任务。这些标注难以用有限的训练数据建模。独立抽取信息而忽略标注关系的系统取得了最高 F1 分数。同时,具有通用能力的 LLM 在遵循标注关系的同时取得了高 F1 分数。基于规则处理关系抽取的系统 F1 分数较低,却是最可解释的方法。结论:在本挑战赛设定下三个系统的 F1 分数各异,但每种方法在实际应用中有优缺点。方法的选择不仅取决于 F1 分数,也取决于应用中的需求。

关键词

引用

@article{arxiv.2301.11386,
  title  = {Task formulation for Extracting Social Determinants of Health from Clinical Narratives},
  author = {Manabu Torii and Ian M. Finn and Son Doan and Paul Wang and Elly W. Yang and Daniel S. Zisook},
  journal= {arXiv preprint arXiv:2301.11386},
  year   = {2023}
}