PrIeD-KIE:面向隐私保护的文档关键信息抽取
计算与语言
2023-10-09 v1
摘要
在本文中,我们介绍了通过利用大型预训练文档基础模型,结合差分隐私(differential privacy, DP)、联邦学习(federated learning, FL)和差分隐私联邦学习(Differentially Private Federated Learning, DP-FL)来开发私有关键信息抽取(Key Information Extraction, KIE)系统的策略。通过在六个基准数据集(FUNSD、CORD、SROIE、WildReceipts、XFUND 和 DOCILE)上的大量实验,我们证明了大型文档基础模型可以在私有设置下被有效地微调用于 KIE 任务,在保持强隐私保证的同时取得足够的性能。此外,通过深入分析各种训练和模型参数对模型性能的影响,我们提出了简单而有效的准则,以在全局 DP 下实现 KIE 任务的最优隐私-效用权衡。最后,我们引入了 FeAm-DP,一种新颖的 DP-FL 算法,能够将全局 DP 从独立环境高效扩展到多客户端联邦环境。我们在各种客户端和隐私设置下对该算法进行了全面评估,并证明其即使容纳不断增加的参与客户端数量,也能取得与独立 DP 相当的性能和隐私保证。总体而言,我们的研究为私有 KIE 系统的开发提供了有价值的见解,并凸显了文档基础模型在隐私保护文档 AI 应用中的潜力。据作者所知,这是首个利用文档基础模型探索隐私保护文档 KIE 的工作。
引用
@article{arxiv.2310.03777,
title = {PrIeD-KIE: Towards Privacy Preserved Document Key Information Extraction},
author = {Saifullah Saifullah and Stefan Agne and Andreas Dengel and Sheraz Ahmed},
journal= {arXiv preprint arXiv:2310.03777},
year = {2023}
}