AnE:通过锚点演化推动多模态大语言模型推理边界
计算机视觉与模式识别
2026-05-26 v1
摘要
通过监督微调(SFT)和强化学习(RL)是增强多模态大语言模型(MLLM)推理能力的关键手段,但现有范式常因静态数据限制而达到性能瓶颈。虽然当前方法利用自反思或自演化推动突破,但仍因低质量合成数据导致认知漂移和幻觉式推理路径。为解决这些挑战,我们提出Anchor Evolution(AnE),一种集成真实锚点数据策划与模型演化的新范式,实现推理边界的可靠性和稳定性提升。具体而言,我们提出Truth Anchor Expansion,通过轨迹 rollout 识别模型失效边缘,并利用真实数据库检索高保真锚点,以实现可靠的数据策划。随后,我们引入Scaffold-Stripping机制来内化推理能力。该机制首先通过带Scaffold增强监督锚定推理路径,以缓解直接在原始数据上进行SFT的学习复杂度和分布漂移,然后利用RL剥离Scaffold模板,从而有效地将推理路径过渡为内在模型能力。在多模态推理基准测试中进行实验结果表明,我们的方法显著推动了模型性能的前沿,使基础模型在八个多模态基准测试中提升了10.3%,实现了最先进的效果。代码将公开发布。
关键词
引用
@article{arxiv.2605.25571,
title = {AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution},
author = {Zehao Wang and Yihan Zeng and Zidong Gong and Yuanfan Guo and Feng Zhu and Hongzhi Zhang and Wei Zhang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2605.25571},
year = {2026}
}
备注
34 pages,10 figures