从合成场景到真实表现:增强视觉语言模型中的空间推理能力
计算机视觉与模式识别
2026-03-24 v2 计算与语言
摘要
微调视觉语言模型(VLM)是提高性能常用的方法,但依赖于对真实场景进行随意的数据收集和标注。这一过程常常容易受偏见、错误和分布不平衡的影响,导致过拟合和性能不均衡。虽然已有一些研究尝试通过生成合成数据来解决此问题,但缺乏对分布偏见和标注质量的控制。为此,我们以两种方式重新设计微调流程:首先,我们控制数据及其标注的生成,确保其免于偏见、分布不平衡和标注错误。我们通过全面采样物体的属性(包括颜色、形状、大小和场景中的位置)来自动构建数据集。其次,使用该标注数据集对最先进的VLM进行微调,并评估其在绝对位置任务上的性能转移到真实数据。我们在合成和真实世界基准上进行详尽评估。实验结果显示,两个关键发现:1)在均衡的合成数据上进行微调可在视觉场景中实现统一的性能,并缓解常见偏见;2)在合成刺激物上进行微调可使真实世界数据(COCO)上的性能提升13%,超过在完整COCO训练集上进行微调的模型。
引用
@article{arxiv.2511.11440,
title = {From Synthetic Scenes to Real Performance: Enhancing Spatial Reasoning in VLMs},
author = {Massimo Rizzoli and Simone Alghisi and Seyed Mahed Mousavi and Giuseppe Riccardi},
journal= {arXiv preprint arXiv:2511.11440},
year = {2026}
}