CARE 关注失败:基于对比锚定反思的可验证多模态推理
机器学习
2026-03-17 v4 人工智能
摘要
基于组相对强化学习与可验证奖励(RLVR)常常浪费其已拥有的最具信息量的数据——即失败案例。当所有采样轨迹都错误时,梯度停滞;当恰好有一条正确时,更新通常忽略其他轨迹为何接近正确却错误,并且信用可能被错误分配给虚假的推理链。我们提出CARE(对比锚定反思),一个面向多模态推理的、以失败为中心的后训练框架,将错误转化为监督信号。CARE结合了:(i) 一个锚定对比目标,它在最佳采样轨迹周围形成一个紧凑的子组和一组语义相近的困难负样本,执行子组内的z-score归一化并仅对负样本进行缩放,同时包含一个全负样本救援机制以防止零信号批次;以及(ii) 反思引导重采样(RGR),一种一次性结构化自我修复方法,它重写一个代表性失败案例并用同一个验证器重新评分,将接近正确的失败转化为可用的正样本,无需任何测试时反思。CARE在提高准确率和训练平滑性的同时,明确增加了来自失败的学习信号占比。在Qwen2.5-VL-7B上,CARE在六个可验证视觉推理基准测试中,相较于GRPO将宏平均准确率提升了4.6个百分点;在Qwen3-VL-8B上,在相同的评估协议下,它在MathVista和MMMU-Pro上达到了具有竞争力或最先进的结果。
引用
@article{arxiv.2512.19554,
title = {CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning},
author = {Yongxin Wang and Zhicheng Yang and Meng Cao and Mingfei Han and Haokun Lin and Yingying Zhu and Xiaojun Chang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2512.19554},
year = {2026}
}