中文

文本与图像均泄露!多模态大语言模型中数据污染的系统分析

计算机视觉与模式识别 2025-09-23 v3 人工智能 计算与语言 多媒体

摘要

多模态大语言模型(MLLM)的快速发展显著提升了基准测试性能。然而,数据污染——训练过程中对基准数据的意外记忆——为公平评估带来了关键挑战。现有的单模态大语言模型(LLM)检测方法由于多模态数据复杂性和多阶段训练而不适用于MLLM。我们使用分析框架MM-Detect系统地分析了多模态数据污染,该框架定义了两种污染类别——单模态和跨模态——并有效量化了多项选择题和基于描述的视觉问答任务中的污染严重程度。对十二个MLLM和五个基准的评估揭示了显著的污染,尤其是在专有模型和较旧基准中。关键的是,污染有时起源于单模态预训练阶段,而非仅来自多模态微调。我们的洞察深化了对污染的理解,指导评估实践并提升多模态模型的可靠性。

关键词

引用

@article{arxiv.2411.03823,
  title  = {Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM},
  author = {Dingjie Song and Sicheng Lai and Mingxuan Wang and Shunian Chen and Lichao Sun and Benyou Wang},
  journal= {arXiv preprint arXiv:2411.03823},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings