中文

长链多模态推理中用于传播感知视觉保持的反思锚点

计算机视觉与模式识别 2026-05-12 v1

摘要

长思维链推理提升了大型视觉-语言模型,但视觉信息在生成过程中常会衰退,限制了长时程多模态推理。现有方法要么在推理时重新注入视觉信息,要么训练策略以实现更强的视觉接地,但何时干预依赖于感知启发式而非有原则的收益分析,且局部视觉影响如何传播仍不明确。我们从信息论角度研究这一问题,并推导出单步干预的下游视觉收益下界,这表明了两个因素:局部分支空间(token 熵)和下游视觉传播潜力(相对于视觉边缘化参考的后缀散度)。在此分析的指导下,我们提出了反思锚点策略优化,这是一种基于 GRPO 的策略优化方法,用于选择高熵反思锚点并优化链掩码有限窗口 KL 替代项以反映下游视觉依赖。在推理密集型和通用领域基准上的实验表明,RAPO 在多个 LVLM 主干上比强基线取得了显著收益。机制分析进一步表明,反思锚点富含视觉敏感决策点,且 RAPO 增强了生成轨迹上的对比视觉依赖信号。

关键词

引用

@article{arxiv.2605.09614,
  title  = {Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning},
  author = {Xuan Gong and Hanbo Huang and Hao Zheng and Yiran Zhang and Wenbin Dai and Weishu Zhao and Shiyu Liang},
  journal= {arXiv preprint arXiv:2605.09614},
  year   = {2026}
}

备注

Under Review