VRD-IU:来自视觉富文档智能与理解的经验
计算机视觉与模式识别
2025-06-03 v1 人工智能
摘要
视觉富文档理解(VRDU)已成为文档智能领域的一个关键领域,能够从医疗、金融和教育应用等跨领域的复杂文档中自动提取关键信息。然而,表单类文档由于其复杂的布局、多方利益相关者的参与以及高度的结构变异性,带来了独特的挑战。针对这些问题,引入了 VRD-IU 竞赛,重点是在 Form-NLU 数据集内从多格式表单中提取和定位关键信息,该数据集包括数字、打印和手写文档。本文介绍了该竞赛的见解,竞赛包含两个赛道:赛道 A 侧重于基于实体的关键信息检索,赛道 B 针对从原始文档图像进行端到端关键信息定位。超过20支参赛队伍展示了各种最先进的方法论,包括层次分解、基于 Transformer 的检索、多模态特征融合和先进的目标检测技术。表现最佳的模型在 VRDU 中设定了新的基准,为文档智能提供了有价值的见解。
引用
@article{arxiv.2506.01388,
title = {VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding},
author = {Yihao Ding and Soyeon Caren Han and Yan Li and Josiah Poon},
journal= {arXiv preprint arXiv:2506.01388},
year = {2025}
}
备注
Accepted at IJCAI 2025 Demonstrations Track