中文

基于难度感知分组归一化提升多模态LLM推理能力

计算机视觉与模式识别 2026-02-27 v2

摘要

强化学习可验证奖励(RLVR)和分组相对政策优化(GRPO)已显著提升大型语言模型的推理能力。但将这些方法扩展到多模态设置面临一个关键挑战:基于标准差的归一化容易受到接近正或负奖励的极端样本扰动。与纯文本LLM不同,多模态模型对此类扰动更为敏感,因为感知误差和推理误差都会影响其响应。为此,我们通过感知复杂度(通过视觉熵度量)和推理不确定性(通过模型置信度捕获)来刻画每个样本的难度。基于此刻画,我们提出难度感知分组归一化(Durian)方法,按难度级别重新分组样本并在每个组内共享标准差。我们的做法保留了GRPO在组内差异的同时消除了对极端案例的敏感性,在多个多模态推理基准测试中实现了显著性能提升。

关键词

引用

@article{arxiv.2602.21743,
  title  = {Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization},
  author = {Jinghan Li and Junfeng Fang and Jinda Lu and Yuan Wang and Xiaoyan Guo and Tianyu Zhang and Xiang Wang and Xiangnan He},
  journal= {arXiv preprint arXiv:2602.21743},
  year   = {2026}
}