3MVRD:用于视觉丰富表单文档理解的多模态多任务多教师模型
计算与语言
2024-07-29 v3 计算机视觉与模式识别
摘要
本文提出了一种突破性的多模态、多任务、多教师联合粒度知识蒸馏模型,用于视觉丰富的表单文档理解。该模型旨在通过促进令牌和实体表示之间的细微相关性,利用细粒度和粗粒度层面的见解,以解决表单文档中固有的复杂性。此外,我们引入了新的粒间和跨粒损失函数,以进一步完善多样的多教师知识蒸馏转移过程,呈现分布差距并对表单文档形成和谐的理解。通过对公开可用的表单文档理解数据集进行全面评估,我们提出的模型始终优于现有基线,展示了其在处理视觉复杂表单文档的 intricate 结构和内容方面的有效性。
引用
@article{arxiv.2402.17983,
title = {3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding},
author = {Yihao Ding and Lorenzo Vaiani and Caren Han and Jean Lee and Paolo Garza and Josiah Poon and Luca Cagliero},
journal= {arXiv preprint arXiv:2402.17983},
year = {2024}
}
备注
Accepted at Findings of ACL 2024