从文档理解模型重建训练数据
密码学与安全
2024-06-06 v1
摘要
文档理解模型日益增多地被企业用于取代人类处理敏感文档,如发票、税务通知或身份证。然而,这些模型对隐私攻击的鲁棒性仍未得到充分探索。本文提出了 CDMI,是首个针对这些模型训练数据的敏感字段重建攻击。我们攻击了 LayoutLM 和 BROS 架构,展示了对手可以从这些模型的训练数据中完美重建最多 4.1% 的字段,包括一些姓名、日期和最高可达六位数的发票金额。当我们的重建攻击结合成员推断攻击时,攻击准确率提升至 22.5%。此外,我们引入两个新的端到端指标,并在各种条件下评估我们的方案:单模态或双模态数据、LayoutLM 或 BROS 背bone、四个微调任务和两个公共数据集(FUNSD 和 SROIE)。我们还研究了过拟合、预测性能以及对我们攻击的易受性之间的相互作用。我们以对抗我们攻击的可能防御措施及构建鲁棒文档理解模型的潜在未来研究方向结束讨论。
引用
@article{arxiv.2406.03182,
title = {Reconstructing training data from document understanding models},
author = {Jérémie Dentan and Arnaud Paran and Aymen Shabou},
journal= {arXiv preprint arXiv:2406.03182},
year = {2024}
}