中文

隐私感知的文档视觉问答

计算机视觉与模式识别 2024-09-04 v2 人工智能 机器学习

摘要

文档视觉问答(DocVQA)已迅速成为文档理解的核心任务。然而,尽管文档包含敏感或受版权保护的信息,当前所有DocVQA方法均未提供强有力的隐私保障。本文首次探索DocVQA领域的隐私问题,揭示了用于DocVQA的最先进多模态大语言模型中的隐私隐患,并探讨了可能的解决方案。具体而言,我们聚焦于发票处理这一现实文档理解场景,提出了一个包含发票文档及其相关问答的大规模DocVQA数据集。我们采用联邦学习方案,以反映不同企业中文档的真实分布,并探索将发票提供方的数据作为待保护敏感信息的用例。我们证明非隐私模型倾向于记忆,这种行为可能导致隐私信息泄露。随后,我们评估了在此多模态场景下采用联邦学习和差分隐私的基线训练方案,其中敏感信息可能通过两种输入模态(视觉(文档图像)或语言(OCR令牌))之一或两者同时暴露。最后,我们设计了利用模型记忆效应的攻击,并证明了其在探测代表性DocVQA模型方面的有效性。

关键词

引用

@article{arxiv.2312.10108,
  title  = {Privacy-Aware Document Visual Question Answering},
  author = {Rubèn Tito and Khanh Nguyen and Marlon Tobaben and Raouf Kerkouche and Mohamed Ali Souibgui and Kangsoo Jung and Joonas Jälkö and Vincent Poulain D'Andecy and Aurelie Joseph and Lei Kang and Ernest Valveny and Antti Honkela and Mario Fritz and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2312.10108},
  year   = {2024}
}

备注

35 pages, 12 figures, accepted for publication at the 18th International Conference on Document Analysis and Recognition, ICDAR 2024