English

Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM

Computer Vision and Pattern Recognition 2025-09-23 v3 Artificial Intelligence Computation and Language Multimedia

Abstract

The rapid advancement of multimodal large language models (MLLMs) has significantly enhanced performance across benchmarks. However, data contamination-unintentional memorization of benchmark data during model training-poses critical challenges for fair evaluation. Existing detection methods for unimodal large language models (LLMs) are inadequate for MLLMs due to multimodal data complexity and multi-phase training. We systematically analyze multimodal data contamination using our analytical framework, MM-Detect, which defines two contamination categories-unimodal and cross-modal-and effectively quantifies contamination severity across multiple-choice and caption-based Visual Question Answering tasks. Evaluations on twelve MLLMs and five benchmarks reveal significant contamination, particularly in proprietary models and older benchmarks. Crucially, contamination sometimes originates during unimodal pre-training rather than solely from multimodal fine-tuning. Our insights refine contamination understanding, guiding evaluation practices and improving multimodal model reliability.

Keywords

Cite

@article{arxiv.2411.03823,
  title  = {Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM},
  author = {Dingjie Song and Sicheng Lai and Mingxuan Wang and Shunian Chen and Lichao Sun and Benyou Wang},
  journal= {arXiv preprint arXiv:2411.03823},
  year   = {2025}
}

Comments

Accepted to EMNLP 2025 Findings