中文

用于保护患者隐私的上下文学习:合成真实患者门户消息的框架

人工智能 2024-11-12 v1 计算与语言

摘要

自COVID-19大流行以来,临床医生面临着大量且持续的患者门户消息涌入,显著加剧了临床医生的职业倦怠。据我们所知,目前尚无大规模公开的患者门户消息语料库供研究人员用于构建优化临床医生门户工作流的工具。在与一家区域医院持续合作的基础上,本研究提出了一种由大语言模型(LLM)驱动的、可配置且真实可信的患者门户消息生成框架。我们的方法利用少样本接地文本生成,仅需少量已脱敏的患者门户消息即可帮助LLM更好地匹配真实数据的真实风格和语气。我们团队的临床专家认为该框架符合HIPAA要求,这与现有的合成文本生成隐私保护方法不同,后者无法保证所有敏感属性都受到保护。通过广泛的定量和人工评估,我们证明我们的框架生成的数据质量优于同类生成方法以及所有相关数据集。我们相信本研究为(i)发布与真实样本风格相似的大规模合成患者消息数据集,以及(ii)仅需最少人工脱敏工作的HIPAA友好型数据生成提供了一条前进的道路。

关键词

引用

@article{arxiv.2411.06549,
  title  = {In-Context Learning for Preserving Patient Privacy: A Framework for Synthesizing Realistic Patient Portal Messages},
  author = {Joseph Gatto and Parker Seegmiller and Timothy E. Burdick and Sarah Masud Preum},
  journal= {arXiv preprint arXiv:2411.06549},
  year   = {2024}
}

备注

Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 8 pages