DRScaffold:提升轻量级视觉语言模型中稠密场景推理能力
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
轻量级视觉语言模型在标准基准上表现竞争力十足,但在稠密场景推理中常规失败,即需要联合定位和解析多个对象、属性及关系,并通过多步推理实现。这种能力对现实应用至关重要,因为模型必须可靠地解释复杂环境。然而,现有训练信号未为推理步骤与底层视觉实体和关系之间提供明确的锚定,使得轻量级模型可以自由生成虽流畅却缺乏视觉锚定的推理链。为此,我们首先引入DRBench,一个覆盖2,943张图片、14,573个问题的数据集,按三个递进推理层次组织为五个任务类别。基于DRBench,我们提出DRScaffold,一种在不进行架构修改的情况下,将监督目标分解为四个因果有序阶段的监督微调框架,在确保推理锚定的同时实现。在三个轻量级VLM模型上进行实验,在DRBench上实现显著提升,同时保持或改进通用基准的性能。值得注意的是,在DRBench上使用DRScaffold训练的Qwen2.5-VL-3B模型超越了冻结的Qwen2.5-VL-32B,表明结构化监督可在稠密场景推理中替代大量模型规模。我们的代码和模型已发布于 https://github.com/irene-shi/DRScaffold 。
引用
@article{arxiv.2605.26038,
title = {DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models},
author = {Xinrui Shi and Kai Liu and Ziqing Zhang and Jianze Li and Anqi Li and Yulun Zhang},
journal= {arXiv preprint arXiv:2605.26038},
year = {2026}
}