临床笔记中片段的无监督抽取、标注与聚类
计算与语言
2023-11-17 v1
摘要
本工作的动机在于,针对如捷克语等计算资源不足语言的非结构化临床笔记,缺乏准确的无监督信息抽取工具。我们引入了一个通向广泛下游任务的垫脚石,例如患者个体记录的摘要或整合、为国家癌症登记报告抽取结构化信息,或构建用于计算患者嵌入的半结构化语义患者表示。更具体地,我们提出了一种从无结构临床笔记中无监督抽取语义标注文本片段的方法,并在由马萨里克纪念癌症研究所(捷克最大的肿瘤专科医院)提供的捷克乳腺癌患者数据集上进行了测试。我们的目标是抽取、分类(即标注)并聚类对应于特定临床特征(例如家族背景、合并症或毒性)的自由文本笔记片段。所呈现的结果证明了所提方法在构建部署于捷克临床笔记的更复杂抽取与分析流水线方面的实际相关性。
引用
@article{arxiv.2211.11799,
title = {Unsupervised extraction, labelling and clustering of segments from clinical notes},
author = {Petr Zelina and Jana Halámková and Vít Nováček},
journal= {arXiv preprint arXiv:2211.11799},
year = {2023}
}
备注
To be published at the IEEE BIBM 2022 conference