使用 LLM 生成与去标识化印度临床出院小结
计算与语言
2024-07-09 v1 人工智能
机器学习
摘要
医疗数据泄露的后果对患者、医疗服务提供方和支付方都可能是毁灭性的。据估计,近几个月来数据泄露造成的平均财务影响接近 1000 万美元。这对于正在快速推进数字化、同时仍在建立符合法律条文与精神的医疗数据治理程序的印度医疗机构而言尤为重大。基于计算机的个人隐私信息去标识化系统容易受到数据漂移的影响,往往导致其在跨机构环境中失效。因此,必须针对本地医疗数据集对现有去标识化方法进行严格评估,以支持印度数字医疗倡议的安全实施。利用某印度医疗机构提供的一小部分已去标识化的患者出院小结,本文报告了在公开的非印度数据集上训练的(基于语言模型的)去标识化算法的表面性能,指出其缺乏跨机构泛化能力。类似地,对现成去标识化系统的实验也揭示了该方法相关的潜在风险。为克服数据稀缺问题,我们探索了通过在大语言模型(LLM)上进行上下文学习来生成合成临床报告(使用公开可用的摘要和印度摘要)。我们的实验表明,将生成的报告用作创建具有良好泛化能力的高性能去标识化系统的一种有效策略。
引用
@article{arxiv.2407.05887,
title = {Generation and De-Identification of Indian Clinical Discharge Summaries using LLMs},
author = {Sanjeet Singh and Shreya Gupta and Niralee Gupta and Naimish Sharma and Lokesh Srivastava and Vibhu Agarwal and Ashutosh Modi},
journal= {arXiv preprint arXiv:2407.05887},
year = {2024}
}
备注
Accepted at BioNLP Workshop at ACL 2024; 21 pages (9 pages main content)