中文

Detached Skip-Links 与 $R$-Probe:解耦特征聚合与梯度传播用于MLLM OCR

计算机视觉与模式识别 2026-05-27 v2 人工智能

摘要

多模态大语言模型(MLLM)在高层推理方面表现出色,但在OCR任务中因细粒度视觉细节被牺牲或错位。我们识别出一种被忽视的优化问题:多层特征融合中的跳跃路径。跳跃路径引入了从高级语义目标到早期视觉层的直接反向传播路径。这种机制会覆盖低层信号并 destabilize 训练。为缓解这种梯度干扰,我们提出Detached Skip-Links,一种最小修改,既在前向传递中重用浅层特征,又在联合训练期间停止通过跳跃分支的梯度。这一非对称设计减少了梯度干扰,在不增加可学习参数的情况下提高了稳定性和收敛性。为了诊断细粒度信息是否被保留且对LLM有用,我们引入RR-Probe,该方法测量投影视觉标记在像素级别的可重构性,使用浅层解码器初始化于LLM前四分之一层。我们的方法在多个ViT主干网络和多模态基准测试中,包括最高达700万训练样本,始终改进了以OCR为中心的基准测试,并在一般多模态任务中实现明显提升。

关键词

引用

@article{arxiv.2603.20020,
  title  = {Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR},
  author = {Ziye Yuan and Ruchang Yao and Chengxin Zheng and Yusheng Zhao and Daxiang Dong and Ming Zhang},
  journal= {arXiv preprint arXiv:2603.20020},
  year   = {2026}
}

备注

Accepted by ICML 2026. Ziye Yuan and Ruchang Yao contributed equally to this work (co-first authors, listed in random order)