Computer Vision and Pattern Recognition · Computer Science
A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
Yihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang +5
2026-04-22
Computation and Language · Computer Science
VRDU: A Benchmark for Visually-rich Document Understanding
Zilong Wang, Yichao Zhou, Wei Wei, Chen-Yu Lee +1
2023-09-19
Computer Vision and Pattern Recognition · Computer Science
ERNIE-mmLayout: Multi-grained MultiModal Transformer for Document Understanding
Wenjin Wang, Zhengjie Huang, Bin Luo, Qianglong Chen +7
2022-09-20
Computation and Language · Computer Science
Deep Learning based Visually Rich Document Content Understanding: A Survey
Yihao Ding, Soyeon Caren Han, Jean Lee, Eduard Hovy
2025-06-23
Information Retrieval · Computer Science
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
Hao Yang, Yifan Ji, Zhipeng Xu, Zhenghao Liu +5
2026-04-10
Computer Vision and Pattern Recognition · Computer Science
VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding
Yihao Ding, Soyeon Caren Han, Yan Li, Josiah Poon
2025-06-03
Computation and Language · Computer Science
MarkupLM: Pre-training of Text and Markup Language for Visually-rich Document Understanding
Junlong Li, Yiheng Xu, Lei Cui, Furu Wei
2022-03-14
Computation and Language · Computer Science
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
Zhiming Mao, Haoli Bai, Lu Hou, Jiansheng Wei +3
2024-03-28
Computer Vision and Pattern Recognition · Computer Science
LayoutMask: Enhance Text-Layout Interaction in Multi-modal Pre-training for Document Understanding
Yi Tu, Ya Guo, Huan Chen, Jinyang Tang
2023-06-12
Computation and Language · Computer Science
Enhancing Visually-Rich Document Understanding via Layout Structure Modeling
Qiwei Li, Zuchao Li, Xiantao Cai, Bo Du +1
2023-08-16
Computer Vision and Pattern Recognition · Computer Science
XYLayoutLM: Towards Layout-Aware Multimodal Networks For Visually-Rich Document Understanding
Zhangxuan Gu, Changhua Meng, Ke Wang, Jun Lan +3
2022-03-16
Computation and Language · Computer Science
ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding
Qiming Peng, Yinxu Pan, Wenjin Wang, Bin Luo +11
2022-10-17
Computer Vision and Pattern Recognition · Computer Science
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
Chuwei Luo, Guozhi Tang, Qi Zheng, Cong Yao +4
2025-06-19
Computation and Language · Computer Science
A LayoutLMv3-Based Model for Enhanced Relation Extraction in Visually-Rich Documents
Wiam Adnan, Joel Tang, Yassine Bel Khayat Zouggari, Seif Edinne Laatiri +2
2024-04-18
Computer Vision and Pattern Recognition · Computer Science
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
Souhail Bakkali, Sanket Biswas, Zuheng Ming, Mickaël Coustaty +3
2024-11-06
Artificial Intelligence · Computer Science
Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding
Yihao Ding, Qiang Sun, Puzhen Wu, Sirui Li +2
2026-01-21
Computer Vision and Pattern Recognition · Computer Science
Refined Vision-Language Modeling for Fine-grained Multi-modal Pre-training
Lisai Zhang, Qingcai Chen, Zhijian Chen, Yunpeng Han +2
2023-05-09
Computer Vision and Pattern Recognition · Computer Science
Document Understanding Dataset and Evaluation (DUDE)
Jordy Van Landeghem, Rubén Tito, Łukasz Borchmann, Michał Pietruszka +9
2023-09-12
Computer Vision and Pattern Recognition · Computer Science
VSR: A Unified Framework for Document Layout Analysis combining Vision, Semantics and Relations
Peng Zhang, Can Li, Liang Qiao, Zhanzhan Cheng +3
2021-05-14
Computation and Language · Computer Science
Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
Chong Zhang, Yi Tu, Yixi Zhao, Chenshu Yuan +7
2024-10-01
Computation and Language · Computer Science
LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document Understanding
Zhivar Sourati, Zheng Wang, Marianne Menglin Liu, Yazhe Hu +7
2026-03-03
Computer Vision and Pattern Recognition · Computer Science
SynDoc: A Hybrid Discriminative-Generative Framework for Enhancing Synthetic Domain-Adaptive Document Key Information Extraction
Yihao Ding, Soyeon Caren Han, Yanbei Jiang, Yan Li +2
2025-09-30
Computer Vision and Pattern Recognition · Computer Science
A Novel Attention-based Aggregation Function to Combine Vision and Language
Matteo Stefanini, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara
2020-07-14