MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
Abstract
This paper reviews the MARS2 2025 Challenge on Multimodal Reasoning. We aim to bring together different approaches in multimodal machine learning and LLMs via a large benchmark. We hope it better allows researchers to follow the state-of-the-art in this very dynamic area. Meanwhile, a growing number of testbeds have boosted the evolution of general-purpose large language models. Thus, this year's MARS2 focuses on real-world and specialized scenarios to broaden the multimodal reasoning applications of MLLMs. Our organizing team released two tailored datasets Lens and AdsQA as test sets, which support general reasoning in 12 daily scenarios and domain-specific reasoning in advertisement videos, respectively. We evaluated 40+ baselines that include both generalist MLLMs and task-specific models, and opened up three competition tracks, i.e., Visual Grounding in Real-world Scenarios (VG-RS), Visual Question Answering with Spatial Awareness (VQA-SA), and Visual Reasoning in Creative Advertisement Videos (VR-Ads). Finally, 76 teams from the renowned academic and industrial institutions have registered and 40+ valid submissions (out of 1200+) have been included in our ranking lists. Our datasets, code sets (40+ baselines and 15+ participants' methods), and rankings are publicly available on the MARS2 workshop website and our GitHub organization page https://github.com/mars2workshop/, where our updates and announcements of upcoming events will be continuously provided.
Cite
@article{arxiv.2509.14142,
title = {MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook},
author = {Peng Xu and Shengwu Xiong and Jiajun Zhang and Yaxiong Chen and Bowen Zhou and Chen Change Loy and David A. Clifton and Kyoung Mu Lee and Luc Van Gool and Ruiming He and Ruilin Yao and Xinwei Long and Jirui Huang and Kai Tian and Sa Yang and Yihua Shao and Jin Feng and Yue Zhong and Jiakai Zhou and Cheng Tang and Tianyu Zou and Yifang Zhang and Junming Liang and Guoyou Li and Zhaoxiang Wang and Qiang Zhou and Yichen Zhao and Shili Xiong and Hyeongjin Nam and Jaerin Lee and Jaeyoung Chung and JoonKyu Park and Junghun Oh and Kanggeon Lee and Wooseok Lee and Juneyoung Ro and Turghun Osman and Can Hu and Chaoyang Liao and Cheng Chen and Chengcheng Han and Chenhao Qiu and Chong Peng and Cong Xu and Dailin Li and Feiyu Wang and Feng Gao and Guibo Zhu and Guopeng Tang and Haibo Lu and Han Fang and Han Qi and Hanxiao Wu and Haobo Cheng and Hongbo Sun and Hongyao Chen and Huayong Hu and Hui Li and Jiaheng Ma and Jiang Yu and Jianing Wang and Jie Yang and Jing He and Jinglin Zhou and Jingxuan Li and Josef Kittler and Lihao Zheng and Linnan Zhao and Mengxi Jia and Muyang Yan and Nguyen Thanh Thien and Pu Luo and Qi Li and Shien Song and Shijie Dong and Shuai Shao and Shutao Li and Taofeng Xue and Tianyang Xu and Tianyi Gao and Tingting Li and Wei Zhang and Weiyang Su and Xiaodong Dong and Xiao-Jun Wu and Xiaopeng Zhou and Xin Chen and Xin Wei and Xinyi You and Xudong Kang and Xujie Zhou and Xusheng Liu and Yanan Wang and Yanbin Huang and Yang Liu and Yang Yang and Yanglin Deng and Yashu Kang and Ye Yuan and Yi Wen and Yicen Tian and Yilin Tao and Yin Tang and Yipeng Lin and Yiqing Wang and Yiting Xi and Yongkang Yu and Yumei Li and Yuxin Qin and Yuying Chen and Yuzhe Cen and Zhaofan Zou and Zhaohong Liu and Zhehao Shen and Zhenglin Du and Zhengyang Li and Zhenni Huang and Zhenwei Shao and Zhilong Song and Zhiyong Feng and Zhiyu Wang and Zhou Yu and Ziang Li and Zihan Zhai and Zijian Zhang and Ziyang Peng and Ziyun Xiao and Zongshu Li},
journal= {arXiv preprint arXiv:2509.14142},
year = {2025}
}
Comments
ICCV 2025 MARS2 Workshop and Challenge "Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond''