Computer Vision and Pattern Recognition · Computer Science
A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise
Chaoyou Fu, Renrui Zhang, Zihan Wang, Yubo Huang +14
2023-12-21
Computer Vision and Pattern Recognition · Computer Science
Benchmarking Large and Small MLLMs
Xuelu Feng, Yunsheng Li, Dongdong Chen, Mei Gao +3
2025-01-09
Computer Vision and Pattern Recognition · Computer Science
Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Cases
Zhangyang Qi, Ye Fang, Mengchen Zhang, Zeyi Sun +5
2023-12-27
Computation and Language · Computer Science
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
Xiang Li, Wenyue Hua, Kaijie Zhu, Lingyao Li +7
2025-08-28
Artificial Intelligence · Computer Science
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
Arnau Igualde Sáez, Lamyae Rhomrasi, Yusef Ahsini, Ricardo Vinuesa +4
2025-06-10
Image and Video Processing · Electrical Eng. & Systems
An Early Investigation into the Utility of Multimodal Large Language Models in Medical Imaging
Sulaiman Khan, Md. Rafiul Biswas, Alina Murad, Hazrat Ali +1
2024-06-05
Computation and Language · Computer Science
Lost in Translation: When GPT-4V(ision) Can't See Eye to Eye with Text. A Vision-Language-Consistency Analysis of VLLMs and Beyond
Xiang Zhang, Senyu Li, Zijun Wu, Ning Shi
2023-10-20
Artificial Intelligence · Computer Science
CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs
Yongkang Du, Xiaohan Zou, Minhao Cheng, Lu Lin
2026-03-31
Computation and Language · Computer Science
Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models
Songtao Jiang, Yan Zhang, Chenyi Zhou, Yeying Jin +3
2024-04-09
Computation and Language · Computer Science
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
Yunxin Li, Longyue Wang, Baotian Hu, Xinyu Chen +4
2024-08-27
Computer Vision and Pattern Recognition · Computer Science
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
Haz Sameen Shahgir, Khondker Salman Sayeed, Abhik Bhattacharjee, Wasi Uddin Ahmad +2
2024-08-12
Computer Vision and Pattern Recognition · Computer Science
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
Chengyue Huang, Yuchen Zhu, Sichen Zhu, Jingyun Xiao +3
2025-06-10
Computer Vision and Pattern Recognition · Computer Science
NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders
Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski +4
2026-03-27
Computer Vision and Pattern Recognition · Computer Science
GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks
Xinlu Zhang, Yujie Lu, Weizhi Wang, An Yan +6
2023-11-03
Artificial Intelligence · Computer Science
Evaluation of LLMs for mathematical problem solving
Ruonan Wang, Runxi Wang, Yunwen Shen, Chengfeng Wu +2
2025-07-01
Computer Vision and Pattern Recognition · Computer Science
Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision
Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla +5
2026-03-18
Computer Vision and Pattern Recognition · Computer Science
GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu +89
2026-01-05
Computation and Language · Computer Science
MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks
Sanchit Ahuja, Divyanshu Aggarwal, Varun Gumma, Ishaan Watts +7
2024-04-04
Computer Vision and Pattern Recognition · Computer Science
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
Davide Bucciarelli, Nicholas Moratelli, Marcella Cornia, Lorenzo Baraldi +1
2024-12-06
Computer Vision and Pattern Recognition · Computer Science
From GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalities
Chaochao Lu, Chen Qian, Guodong Zheng, Hongxing Fan +32
2024-01-30