中文

高价值数据选择:高效多模态推理

计算机视觉与模式识别 2026-02-13 v2 人工智能 多媒体

摘要

尽管多模态大语言模型(MLLMs)通过强化学习在复杂推理任务中取得了显著进展,但人们常认为需要大量训练数据才能提升多模态推理能力,这不可避免地导致数据冗余和巨大的计算成本。然而,规模较小的高价值数据集是否能匹配或超越完整语料库以实现多模态推理呢?本文通过一个关键观察挑战了这一假设:有意义的多模态推理仅由稀疏子集训练样本触发,称为认知样本,而绝大多数样本仅贡献微小价值。基于这一洞见,我们提出了一种新颖的数据选择范式,称为推理激活潜能(RAP),通过两种互补估计算法识别认知样本:1) 基于潜在结果模型原则的因果差异估计算法(CDE),通过比较多模态和文本-only输入的输出来消除过度依赖语言先验的样本;2) 注意力置信度估计算法(ACE),利用token级自注意力机制摒弃中间推理阶段中被不相关但被过度强调的token。此外,我们引入了难度感知替换模块(DRM),以替换平凡实例为具有认知挑战性的实例,确保稳健的多模态推理。六个数据集上的实验表明,我们的RAP方法仅使用9.3%的训练数据即可实现优异性能,计算成本降低超过43%。

关键词

引用

@article{arxiv.2506.04755,
  title  = {Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning},
  author = {Shenshen Li and Xing Xu and Kaiyuan Deng and Lei Wang and Heng Tao Shen and Fumin Shen},
  journal= {arXiv preprint arXiv:2506.04755},
  year   = {2026}
}

备注

Under Review