中文

一种用于临床文本分析的隐私保护无监督域自适应框架

计算与语言 2022-01-20 v1

摘要

无监督域自适应(UDA)通常将无标签目标域数据对齐到源域分布以缓解分布偏移问题。标准UDA需要与目标方共享源数据,存在数据隐私泄露风险。为保护源数据隐私,我们首先提出共享源特征分布而非源数据。然而,仅共享源特征分布仍可能遭受成员推断攻击,攻击者可通过黑盒访问源模型推断个体成员身份。为解决该隐私问题,我们进一步研究未被充分探索的隐私保护域自适应问题,并提出一种具有新颖差分隐私训练策略的方法来保护源数据隐私。我们在差分隐私设定下通过高斯混合模型(GMMs)建模源特征分布,并将其发送至目标客户端用于自适应。目标客户端从GMMs中重采样差分隐私源特征,并使用若干先进UDA主干网络在目标数据上自适应。借助所提方法,源数据提供方可在域自适应过程中避免泄露源数据隐私,同时保留效用。为评估所提方法的效用与隐私损失,我们使用两个含噪声且具有挑战性的临床文本数据集,将模型应用于医疗报告疾病标签分类任务。结果表明,所提方法可在对文本分类任务性能影响较小的情况下保护源数据隐私。

关键词

引用

@article{arxiv.2201.07317,
  title  = {A Privacy-Preserving Unsupervised Domain Adaptation Framework for Clinical Text Analysis},
  author = {Qiyuan An and Ruijiang Li and Lin Gu and Hao Zhang and Qingyu Chen and Zhiyong Lu and Fei Wang and Yingying Zhu},
  journal= {arXiv preprint arXiv:2201.07317},
  year   = {2022}
}