联邦文档视觉问答:一项初步研究
计算机视觉与模式识别
2024-05-24 v2 人工智能
计算与语言
机器学习
摘要
文档分析研究的一个重要障碍是,文档往往受版权保护或包含私人信息,这禁止了其公开发布以及集中式大规模文档数据集的创建。相反,文档分散在私有的数据孤岛中,使得在异构数据上进行广泛训练成为一项繁琐的任务。在这项工作中,我们探索使用联邦学习(FL)方案,作为一种在去中心化的私有文档数据上训练共享模型的方法。我们专注于文档视觉问答(Document VQA)问题,该任务特别适合这种方法,因为不同领域对模型所需的推理能力类型可能差异很大。因此,在异构文档数据集上实现训练可以显著丰富DocVQA模型。我们汇集了来自不同领域的现有DocVQA数据集,以反映现实应用中的数据异构性。我们探索了在这种多模态环境下的自预训练技术,其中相同的数据同时用于预训练和微调,使其与隐私保护相关。我们进一步提出将自预训练与一种使用集中式自适应优化的联邦DocVQA训练方法相结合,其性能优于FedAvg基线。通过大量实验,我们还对使用联邦学习训练DocVQA模型进行了多方面的分析,为该任务的未来研究提供了见解。我们表明,我们的预训练策略能够在具有多样化DocVQA数据集的联邦训练下有效学习并扩展,并且超参数调优对于联邦下的实际文档任务至关重要。
引用
@article{arxiv.2405.06636,
title = {Federated Document Visual Question Answering: A Pilot Study},
author = {Khanh Nguyen and Dimosthenis Karatzas},
journal= {arXiv preprint arXiv:2405.06636},
year = {2024}
}