Artificial Intelligence · Computer Science
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
Huanjin Yao, Jiaxing Huang, Yawen Qiu, Michael K. Chen +8
2025-07-01
Computer Vision and Pattern Recognition · Computer Science
InfiMM-Eval: Complex Open-Ended Reasoning Evaluation For Multi-Modal Large Language Models
Xiaotian Han, Quanzeng You, Yongfei Liu, Wentao Chen +8
2023-12-06
Computation and Language · Computer Science
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
Qianqi Yan, Yue Fan, Hongquan Li, Shan Jiang +4
2025-06-12
Computer Vision and Pattern Recognition · Computer Science
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
Yexin Liu, Zhengyang Liang, Yueze Wang, Xianfeng Wu +7
2025-03-20
Computation and Language · Computer Science
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
Botian Jiang, Lei Li, Xiaonan Li, Zhaowei Li +4
2024-10-17
Computer Vision and Pattern Recognition · Computer Science
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
Chaoyou Fu, Yi-Fan Zhang, Shukang Yin, Bo Li +8
2024-12-10
Artificial Intelligence · Computer Science
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
Guiyao Tie, Xueyang Zhou, Tianhe Gu, Ruihang Zhang +6
2025-07-03
Artificial Intelligence · Computer Science
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
Jiakang Yuan, Tianshuo Peng, Yilei Jiang, Yiting Lu +7
2025-05-28
Artificial Intelligence · Computer Science
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
Lin Li, Guikun Chen, Hanrong Shi, Jun Xiao +1
2024-09-30
Computer Vision and Pattern Recognition · Computer Science
Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models
Mingwei Zhu, Leigang Sha, Yu Shu, Kangjia Zhao +2
2023-10-23
Computation and Language · Computer Science
A Survey on Benchmarks of Multimodal Large Language Models
Jian Li, Weiheng Lu, Hao Fei, Meng Luo +10
2024-09-09
Computation and Language · Computer Science
ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection
Yibo Yan, Shen Wang, Jiahao Huo, Hang Li +12
2026-04-21
Computation and Language · Computer Science
LLMRefine: Pinpointing and Refining Large Language Models via Fine-Grained Actionable Feedback
Wenda Xu, Daniel Deutsch, Mara Finkelstein, Juraj Juraska +5
2024-10-28
Computer Vision and Pattern Recognition · Computer Science
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin +10
2025-10-27
Computation and Language · Computer Science
MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
Haochen Xue, Feilong Tang, Ming Hu, Yexin Liu +12
2025-03-11
Computation and Language · Computer Science
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
Boyu Jia, Junzhe Zhang, Huixuan Zhang, Xiaojun Wan
2025-03-10
Computation and Language · Computer Science
Can We Edit Multimodal Large Language Models?
Siyuan Cheng, Bozhong Tian, Qingbin Liu, Xi Chen +3
2024-04-19
Computer Vision and Pattern Recognition · Computer Science
ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao +1
2025-12-05
Computation and Language · Computer Science
MAF: Multi-Aspect Feedback for Improving Reasoning in Large Language Models
Deepak Nathani, David Wang, Liangming Pan, William Yang Wang
2023-10-20
Computation and Language · Computer Science
MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning
Justin Chih-Yao Chen, Archiki Prasad, Swarnadeep Saha, Elias Stengel-Eskin +1
2025-09-18
Computation and Language · Computer Science
MM-BigBench: Evaluating Multimodal Models on Multimodal Content Comprehension Tasks
Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang +6
2023-10-16
Computer Vision and Pattern Recognition · Computer Science
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
Junzhe Zhang, Huixuan Zhang, Xunjian Yin, Baizhou Huang +3
2024-10-31
Computer Vision and Pattern Recognition · Computer Science
MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu +5
2026-04-21
Artificial Intelligence · Computer Science
MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
Jinhao Chen, Zhen Yang, Jianxin Shi, Tianyu Wo +1
2025-11-11