中文

LDP:通过语言解耦预训练实现多语言视觉信息提取的通用方法

计算机视觉与模式识别 2024-12-20 v1 计算与语言 机器学习

摘要

视觉信息提取 (VIE) 在理解半结构化文档方面发挥着关键作用,已开发出多种预训练模型以提升性能。然而,这些工作大多是单语种的(通常是英文)。由于英文与其他语言的预训练语料数量和质量极度不平衡,仅有少数工作能扩展到非英文场景。本文进行了系统实验,表明视觉与布局模态在不同语言的图像之间保持不变性。如果能够将语言偏见从文档图像中解耦,则基于视觉-布局的模型可实现惊人的跨语言泛化。因此,我们提出了一种简单而有效的多语言训练范式 LDP (Language Decoupled Pre-training),以更好地利用单语种预训练数据。我们提出的模型 LDM (Language Decoupled Model) 首先在语言无关数据上进行预训练,其中语言知识通过扩散模型进行解耦,然后在下游语言上进行 fine-tuning。大量实验表明,LDM 在所有 SOTA 多语言预训练模型中都表现出色,也在下游单语/英文基准测试中保持竞争力。

关键词

引用

@article{arxiv.2412.14596,
  title  = {LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining},
  author = {Huawen Shen and Gengluo Li and Jinwen Zhong and Yu Zhou},
  journal= {arXiv preprint arXiv:2412.14596},
  year   = {2024}
}

备注

Accepted by AAAI2025