中文

CARE-SD:基于分类器的电子健康记录中污名化与怀疑标记标签的识别与消除分析:模型开发与验证

计算与语言 2025-07-15 v1

摘要

目的:使用自然语言处理技术检测和分类重症监护电子健康记录(EHRs)中污名化和偏见语言的特征。材料与方法:我们首先根据文献驱动的词根,为 EHRs 中的污名化患者标签、怀疑标记和引号语言特征创建了词典和正则表达式列表。该词典使用 Word2Vec 和 GPT 3.5 进一步扩展,并通过人工评估进行细化。这些词典被用于在来自去标识化的重症监护医学信息集市-III(MIMIC-III)数据集的 1800 万个句子中搜索匹配项。对于每种语言偏见特征,采样 1000 个匹配句子,由临床和公共卫生专家标注员进行标注,并用于监督学习分类器。结果:从扩展的文献词根列表开发词典得到了一个包含 58 个表达式的怀疑标记词典和一个包含 127 个表达式的污名化标签词典。针对怀疑标记和污名化标签的分类器表现最佳,宏观 F1 分数分别为 .84 和 .79,正标签召回率和精确率值介于 .71 到 .86 之间,准确率与人工标注员的一致性(.87)高度吻合。讨论:本研究证明了监督分类器在自动识别医疗文本中的污名化标签和怀疑标记方面的可行性,并识别了 EHR 环境中污名化语言使用的趋势。额外的标注数据可能有助于提高较低的引号模型性能。结论:本研究开发的分类器表现出很高的模型性能,可应用于识别模式并针对性地进行干预,以减少医疗保健系统中的污名化标签和怀疑标记。

关键词

引用

@article{arxiv.2405.05204,
  title  = {CARE-SD: Classifier-based analysis for recognizing and eliminating stigmatizing and doubt marker labels in electronic health records: model development and validation},
  author = {Drew Walker and Annie Thorne and Sudeshna Das and Jennifer Love and Hannah LF Cooper and Melvin Livingston and Abeed Sarker},
  journal= {arXiv preprint arXiv:2405.05204},
  year   = {2025}
}

备注

28 pages, 3 figures, 4 tables. 5 Appendices