Computer Vision and Pattern Recognition · Computer Science
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao +14
2025-11-26
Computer Vision and Pattern Recognition · Computer Science
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
Changda Zhou, Ziyue Gao, Xueqing Wang, Tingquan Gao +3
2026-03-05
Computer Vision and Pattern Recognition · Computer Science
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao +14
2026-04-06
Computer Vision and Pattern Recognition · Computer Science
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
Jiarui Zhang, Yuliang Liu, Zijun Wu, Guosheng Pang +16
2025-11-18
Computer Vision and Pattern Recognition · Computer Science
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang +10
2026-03-26
Computer Vision and Pattern Recognition · Computer Science
PaddleOCR 3.0 Technical Report
Cheng Cui, Ting Sun, Manhui Lin, Tingquan Gao +15
2025-07-09
Computation and Language · Computer Science
CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing
Zhipeng Xu, Junhao Ji, Zulong Chen, Zhenghao Liu +9
2026-05-06
Computer Vision and Pattern Recognition · Computer Science
Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
Sankalp Nagaonkar, Augustya Sharma, Ashish Choithani, Ashutosh Trivedi
2025-02-11
Computer Vision and Pattern Recognition · Computer Science
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
Ling Fu, Zhebin Kuang, Jiajun Song, Mingxin Huang +20
2025-06-06
Computer Vision and Pattern Recognition · Computer Science
DocVLM: Make Your VLM an Efficient Reader
Mor Shpigel Nacson, Aviad Aberdam, Roy Ganz, Elad Ben Avraham +4
2024-12-13
Artificial Intelligence · Computer Science
RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang +3
2025-12-02
Computer Vision and Pattern Recognition · Computer Science
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
An-Lan Wang, Jingqun Tang, Liao Lei, Hao Feng +9
2025-05-28
Computer Vision and Pattern Recognition · Computer Science
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
Yongkun Du, Pinxuan Chen, Xuye Ying, Zhineng Chen
2025-11-25
Computer Vision and Pattern Recognition · Computer Science
PP-OCRv2: Bag of Tricks for Ultra Lightweight OCR System
Yuning Du, Chenxia Li, Ruoyu Guo, Cheng Cui +8
2021-10-13
Computer Vision and Pattern Recognition · Computer Science
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
Zhibo Yang, Jun Tang, Zhaohai Li, Pengfei Wang +8
2024-12-11
Computer Vision and Pattern Recognition · Computer Science
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
Yiming Zhang, Zicheng Zhang, Xinyi Wei, Xiaohong Liu +2
2025-06-23
Computer Vision and Pattern Recognition · Computer Science
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
Bin Wang, Tianyao He, Linke Ouyang, Fan Wu +39
2026-04-10
Computer Vision and Pattern Recognition · Computer Science
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
Fengbin Zhu, Ziyang Liu, Xiang Yao Ng, Haohui Wu +5
2024-10-30
Computer Vision and Pattern Recognition · Computer Science
Seed1.5-VL Technical Report
Dong Guo, Faming Wu, Feida Zhu, Fuxing Leng +193
2025-05-13
Computer Vision and Pattern Recognition · Computer Science
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
Linke Ouyang, Yuan Qu, Hongbin Zhou, Jiawei Zhu +16
2025-03-26
Computer Vision and Pattern Recognition · Computer Science
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
Hao Feng, Wei Shi, Ke Zhang, Xiang Fei +8
2026-02-06
Computer Vision and Pattern Recognition · Computer Science
Seeing Straight: Document Orientation Detection for Efficient OCR
Suranjan Goswami, Abhinav Ravi, Raja Kolla, Ali Faraz +4
2026-03-17