Computer Vision and Pattern Recognition · Computer Science
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
Zhibo Yang, Jun Tang, Zhaohai Li, Pengfei Wang +8
2024-12-11
Computer Vision and Pattern Recognition · Computer Science
Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark
Ziming Cheng, Binrui Xu, Lisheng Gong, Zuhe Song +13
2025-06-06
Computer Vision and Pattern Recognition · Computer Science
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
Bingchen Zhao, Yongshuo Zong, Letian Zhang, Timothy Hospedales
2024-06-19
Computer Vision and Pattern Recognition · Computer Science
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin +10
2025-10-27
Computer Vision and Pattern Recognition · Computer Science
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
Ling Fu, Zhebin Kuang, Jiajun Song, Mingxin Huang +20
2025-06-06
Machine Learning · Computer Science
OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning
Mingxin Huang, Yongxin Shi, Dezhi Peng, Songxuan Lai +2
2026-05-27
Computation and Language · Computer Science
A Survey on Benchmarks of Multimodal Large Language Models
Jian Li, Weiheng Lu, Hao Fei, Meng Luo +10
2024-09-09
Artificial Intelligence · Computer Science
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
Lin Li, Guikun Chen, Hanrong Shi, Jun Xiao +1
2024-09-30
Computer Vision and Pattern Recognition · Computer Science
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
Chaoyou Fu, Yi-Fan Zhang, Shukang Yin, Bo Li +8
2024-12-10
Computer Vision and Pattern Recognition · Computer Science
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
Haowei Liu, Xi Zhang, Haiyang Xu, Yaya Shi +7
2024-10-10
Computer Vision and Pattern Recognition · Computer Science
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang +2
2025-11-27
Computer Vision and Pattern Recognition · Computer Science
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
Yi-Fan Zhang, Huanyu Zhang, Haochen Tian, Chaoyou Fu +9
2025-02-06
Computer Vision and Pattern Recognition · Computer Science
On Large Multimodal Models as Open-World Image Classifiers
Alessandro Conti, Massimiliano Mancini, Enrico Fini, Yiming Wang +2
2025-10-17
Computer Vision and Pattern Recognition · Computer Science
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta +30
2025-03-07
Computer Vision and Pattern Recognition · Computer Science
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
Pei Fu, Tongkun Guan, Zining Wang, Zhentao Guo +7
2025-02-25
Computer Vision and Pattern Recognition · Computer Science
FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and Challenging
Zichen Tang, Haihong E, Jiacheng Liu, Zhongjun Yang +17
2025-08-07
Artificial Intelligence · Computer Science
FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning
Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao +2
2025-11-25
Computer Vision and Pattern Recognition · Computer Science
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding +4
2025-12-11
Computer Vision and Pattern Recognition · Computer Science
Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models
Mingwei Zhu, Leigang Sha, Yu Shu, Kangjia Zhao +2
2023-10-23
Computer Vision and Pattern Recognition · Computer Science
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
Siwei Wu, Kang Zhu, Yu Bai, Yiming Liang +9
2024-08-07
Machine Learning · Computer Science
Benchmarking Large Multimodal Models against Common Corruptions
Jiawei Zhang, Tianyu Pang, Chao Du, Yi Ren +2
2024-01-23
Computer Vision and Pattern Recognition · Computer Science
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
Hailang Huang, Yong Wang, Zixuan Huang, Huaqiu Li +3
2025-03-11
Computation and Language · Computer Science
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang +4
2026-03-03