中文

被损坏却未崩溃:理解与缓解视觉指令调优数据损坏的负面影响

计算机视觉与模式识别 2025-05-28 v3

摘要

视觉指令调优(VIT)旨在增强多模态大型语言模型(MLLM),但常因包含幻觉内容、错误响应和差质 OCR 质量的损坏数据而削弱其效果。先前用于解决这些挑战的方法主要集中在通过高质量数据收集或基于规则的过滤来精炼数据集,这些方法成本高昂或范围受限。在本文中,我们系统性地调查了损坏数据对 MLLMs 的影响,发现尽管损坏数据会降低模型性能,但这种不利影响大体可逆,MLLMs是“被损坏却未崩溃”。具体而言,我们发现禁用少数参数即可几乎完全恢复性能。此外,损坏的 MLLMs天生具备区分干净样本和损坏样本的能力,这促进了无需外部干预的数据集清洁。基于这些洞见,我们引入一种抗损坏训练范式,显著优于现有缓解损坏数据影响的策略。

关键词

引用

@article{arxiv.2502.12635,
  title  = {Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning},
  author = {Yunhao Gou and Hansi Yang and Zhili Liu and Kai Chen and Yihan Zeng and Lanqing Hong and Zhenguo Li and Qun Liu and Bo Han and James T. Kwok and Yu Zhang},
  journal= {arXiv preprint arXiv:2502.12635},
  year   = {2025}
}