中文

通过头尾再平衡抵消自我提升中马太效应

计算机视觉与模式识别 2025-10-31 v1 人工智能 计算与语言 机器学习

摘要

自我提升已成为推动大型视觉语言模型(LVLMs)推理能力主流范式,其中模型探索并学习成功轨迹。然而,我们识别出这一过程中存在关键问题:模型在生成简单查询(即头数据)的高质量轨迹方面表现出色,但在处理更复杂的查询(即尾数据)方面则Struggles。这导致优化不平衡,使模型优先学习简单推理技能,同时阻碍其解决更复杂推理任务的能力。随着迭代的进行,这种不平衡变得日益严重——我们称之为“马太效应”——最终阻碍了模型的进一步提升并导致性能瓶颈。为抵消这一挑战,我们引入了四种高效策略,从两个角度出发:分布重塑和轨迹重抽样,以实现探索-学习自我提升过程中的头尾再平衡。在视觉推理任务上对 Qwen2-VL-7B-Instruct 和 InternVL2.5-4B 模型进行大量实验,表明我们的方法在视觉推理能力方面 consistently 提升 3.86 个平均分,优于基础自我提升方法。

关键词

引用

@article{arxiv.2510.26474,
  title  = {Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing},
  author = {Xin Guo and Zhiheng Xi and Yiwen Ding and Yitao Zhai and Xiaowei Shi and Xunliang Cai and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2510.26474},
  year   = {2025}
}

备注

Preprint