大语言模型能否成为保护隐私且公平的医学编码器?
机器学习
2024-12-10 v1 密码学与安全
摘要
在医疗保健领域部署机器学习算法时,保护患者数据隐私是一个关键问题。差分隐私(DP)是此类场景中常用的隐私保护方法,在本研究中,我们考察了将DP应用于医学编码(ICD分类)这一NLP任务时的两个关键权衡。关于隐私-效用权衡,我们观察到隐私保护模型的性能显著下降,在MIMIC-III数据集的前50个标签上,微F1分数降低了超过40%。从隐私-公平性权衡的角度来看,我们还观察到DP模型中男性和女性患者之间的召回率差距增加了超过3%。进一步理解这些权衡将有助于应对实际部署中的挑战。
引用
@article{arxiv.2412.05533,
title = {Can large language models be privacy preserving and fair medical coders?},
author = {Ali Dadsetan and Dorsa Soleymani and Xijie Zeng and Frank Rudzicz},
journal= {arXiv preprint arXiv:2412.05533},
year = {2024}
}