中文

通过输入自适应深度聚合缓解视觉-语言微调中的推理代价

计算机视觉与模式识别 2026-03-30 v1 人工智能

摘要

监督微调(SFT)在视觉指令数据上的应用通常能提升视觉-语言模型(VLMs)的感知能力,但会损害推理性能,从而在后训练过程中产生持续的推理代价。我们研究这种退化是否与深度方向表示的访问中断有关,发现即使固定的跨深度聚合也能显著恢复推理能力,这表明保留跨深度访问是 VLM 微调中一个重要的缺失因素。基于这一观察,我们提出了输入自适应深度聚合(IADA),一种轻量级机制,使跨深度检索具有输入自适应性、模态感知性,并通过低秩瓶颈高效参数化。在 Qwen3-VL-2B 上,IADA 在仅增加 0.14M 参数的情况下,相比仅使用 LoRA 微调将平均推理分数提升 9.5 分,平均感知分数提升 3.3 分,最强的增益出现在参数高效的低秩设置中。

关键词

引用

@article{arxiv.2603.26330,
  title  = {Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation},
  author = {Yiming Ren and Yujiu Yang and Junjie Wang},
  journal= {arXiv preprint arXiv:2603.26330},
  year   = {2026}
}