长链多模态推理中用于传播感知视觉保持的反思锚点
计算机视觉与模式识别
2026-05-12 v1
摘要
长思维链推理提升了大型视觉-语言模型,但视觉信息在生成过程中常会衰退,限制了长时程多模态推理。现有方法要么在推理时重新注入视觉信息,要么训练策略以实现更强的视觉接地,但何时干预依赖于感知启发式而非有原则的收益分析,且局部视觉影响如何传播仍不明确。我们从信息论角度研究这一问题,并推导出单步干预的下游视觉收益下界,这表明了两个因素:局部分支空间(token 熵)和下游视觉传播潜力(相对于视觉边缘化参考的后缀散度)。在此分析的指导下,我们提出了反思锚点策略优化,这是一种基于 GRPO 的策略优化方法,用于选择高熵反思锚点并优化链掩码有限窗口 KL 替代项以反映下游视觉依赖。在推理密集型和通用领域基准上的实验表明,RAPO 在多个 LVLM 主干上比强基线取得了显著收益。机制分析进一步表明,反思锚点富含视觉敏感决策点,且 RAPO 增强了生成轨迹上的对比视觉依赖信号。
引用
@article{arxiv.2605.09614,
title = {Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning},
author = {Xuan Gong and Hanbo Huang and Hao Zheng and Yiran Zhang and Wenbin Dai and Weishu Zhao and Shiyu Liang},
journal= {arXiv preprint arXiv:2605.09614},
year = {2026}
}
备注
Under Review