中文

基于深度学习的视觉丰富文档内容理解综述

计算与语言 2025-06-23 v2 计算机视觉与模式识别

摘要

视觉丰富文档(VRDs)在学术、金融、医疗和营销等领域发挥着关键作用,因其通过文本、布局和视觉元素组合来传递信息。传统方法依赖于专家知识和手动标注,耗时且效率低下。近期深度学习的进展通过预训练模型实现视觉、语言和布局特征的多模态集成,显著提升了信息抽取性能。本综述提供了深度学习驱动的VRD内容理解(VRD-CU)框架的全面概览。我们根据建模策略和下游任务对现有方法进行分类,并对关键组件进行比较分析,包括特征表示、融合技术、模型架构和预训练目标。此外,我们概述了每种方法的优势与局限性,并讨论其适用性。本文以讨论当前挑战和新兴趋势结束,为未来研究和实际部署提供指导。

关键词

引用

@article{arxiv.2408.01287,
  title  = {Deep Learning based Visually Rich Document Content Understanding: A Survey},
  author = {Yihao Ding and Soyeon Caren Han and Jean Lee and Eduard Hovy},
  journal= {arXiv preprint arXiv:2408.01287},
  year   = {2025}
}

备注

Work in Progress