LDP:通过语言解耦预训练实现多语言视觉信息提取的通用方法
计算机视觉与模式识别
2024-12-20 v1 计算与语言
机器学习
摘要
视觉信息提取 (VIE) 在理解半结构化文档方面发挥着关键作用,已开发出多种预训练模型以提升性能。然而,这些工作大多是单语种的(通常是英文)。由于英文与其他语言的预训练语料数量和质量极度不平衡,仅有少数工作能扩展到非英文场景。本文进行了系统实验,表明视觉与布局模态在不同语言的图像之间保持不变性。如果能够将语言偏见从文档图像中解耦,则基于视觉-布局的模型可实现惊人的跨语言泛化。因此,我们提出了一种简单而有效的多语言训练范式 LDP (Language Decoupled Pre-training),以更好地利用单语种预训练数据。我们提出的模型 LDM (Language Decoupled Model) 首先在语言无关数据上进行预训练,其中语言知识通过扩散模型进行解耦,然后在下游语言上进行 fine-tuning。大量实验表明,LDM 在所有 SOTA 多语言预训练模型中都表现出色,也在下游单语/英文基准测试中保持竞争力。
引用
@article{arxiv.2412.14596,
title = {LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining},
author = {Huawen Shen and Gengluo Li and Jinwen Zhong and Yu Zhou},
journal= {arXiv preprint arXiv:2412.14596},
year = {2024}
}
备注
Accepted by AAAI2025