中文

用于兽医电子健康记录去标识化的合成数据:固定计算预算下的益处、局限与安全权衡

密码学与安全 2026-01-16 v1 人工智能 计算与语言

摘要

兽医电子健康记录(vEHRs)包含限制二次使用的隐私敏感标识符。虽然PetEVAL为兽医去标识化提供了基准,但该领域仍属低资源领域。本研究评估了大型语言模型(LLM)生成的合成叙述在不同训练策略下是否能提高去标识化安全性,重点关注(i)合成数据增强和(ii)固定预算替换。我们使用PetEVAL衍生语料库(3,750份保留集/1,249份训练集)进行了对照模拟。我们采用一种隐私保护的“仅模板”策略生成了10,382份合成笔记,该策略在LLM提示之前移除了标识符。三种Transformer骨干模型(PetBERT、VetBERT、Bio_ClinicalBERT)在不同的数据混合比例下进行了训练。评估以文档级泄露率(至少遗漏一个标识符的文档比例)作为主要安全性结果。结果显示,在固定样本替换下,用合成笔记替换真实笔记会单调增加泄露率,表明合成数据无法安全地替代真实监督。在计算匹配的训练下,适度的合成数据混合可达到与纯真实数据相当的性能,但高比例的合成数据会降低效用。相反,按轮次扩展的增强策略提升了性能:PetBERT的跨度重叠F1值从0.831提高到0.850 +/- 0.014,泄露率从6.32%降至4.02% +/- 0.19%。然而,这些增益主要反映了训练曝光度的增加,而非合成数据的内在质量。语料库诊断揭示了合成数据与真实数据在笔记长度和标签分布上的系统性不匹配,这与持续的泄露现象相符。我们得出结论,合成数据增强对于扩大训练曝光度是有效的,但对于安全关键的兽医去标识化而言,它是补充性的,而非替代性的。

关键词

引用

@article{arxiv.2601.09756,
  title  = {Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute},
  author = {David Brundage},
  journal= {arXiv preprint arXiv:2601.09756},
  year   = {2026}
}