用于从临床记录中识别患者健康素养信息的数据集与资源
计算与语言
2026-03-20 v1
摘要
健康素养是患者结局的关键决定因素,但当前的筛查工具并非总是可行,且在所捕获的健康素养项目数量、问题格式和维度上差异显著,使得在结构化电子健康记录中进行记录难以实现。从非结构化临床记录中进行自动检测提供了一个有前景的替代方案,因为这些记录通常包含更丰富、更具上下文的健康素养信息,但进展受限于标注资源的匮乏。我们引入了 HEALIX,第一个来自真实临床记录的公开可用标注健康素养数据集,通过社工记录采样、基于关键词的过滤和基于 LLM 的主动学习进行策展。HEALIX 包含 589 条记录,涵盖 9 种记录类型,标注了三个健康素养标签:低、正常和高。为了展示其效用,我们在四个开源大语言模型(LLM)上基准测试了零样本和少样本提示策略。
引用
@article{arxiv.2603.19082,
title = {A Dataset and Resources for Identifying Patient Health Literacy Information from Clinical Notes},
author = {Madeline Bittner and Dina Demner-Fushman and Yasmeen Shabazz and Davis Bartels and Dukyong Yoon and Brad Quitadamo and Rajiv Menghrajani and Leo Celi and Sarvesh Soni},
journal= {arXiv preprint arXiv:2603.19082},
year = {2026}
}