从难度区分视角重新审视多模态后训练中的数据采样
计算机视觉与模式识别
2025-11-11 v1 人工智能
计算与语言
摘要
近期多模态大语言模型(MLLM)的进展推动了链式思考(Chain-of-Thought, CoT)推理的显著进展。基于Deepseek-R1成功经验,研究者将多模态推理扩展至基于强化学习(RL)的后训练范式,主要聚焦数学数据集。然而,现有后训练范式忽视了两个关键方面:(1)缺乏能够对样本进行策略性筛选的可量化难度指标;(2)未能联合优化感知与推理能力的次优后训练范式。为此,我们提出两种新型难度感知采样策略:渐进式图像语义遮蔽(Progressive Image Semantic Masking, PISM)通过系统性图像退化量化样本难度;跨模态注意力平衡(Cross-Modality Attention Balance, CMAB)通过注意力分布分析评估跨模态交互复杂度。借助这些指标,我们设计了包含GRPO-only和SFT+GRPO混合训练范式的层次化训练框架,并在六个基准数据集上进行评估。实验表明,针对难度分层样本应用的GRPO在准确率和常规SFT+GRPO管道方面均实现一致优势,表明策略性数据采样可在提升模型准确率的同时,无需监督微调即可达到更佳效果。我们的代码将发布于https://github.com/qijianyu277/DifficultySampling。
引用
@article{arxiv.2511.06722,
title = {Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View},
author = {Jianyu Qi and Ding Zou and Wenrui Yan and Rui Ma and Jiaxu Li and Zhijie Zheng and Zhiguo Yang and Rongchang Zhao},
journal= {arXiv preprint arXiv:2511.06722},
year = {2025}
}
备注
Accpeted by AAAI 2026