中文

探索原始视觉测量理解及输出格式在视觉语言模型学习中的作用

计算机视觉与模式识别 2025-09-03 v2

摘要

本工作聚焦于当前视觉语言模型(VLM)在原始形状测量理解和属性测量方面的能力,采用以受控二维形状配置为基础的基准测试,涵盖空间定位、遮挡、旋转、尺寸和形状属性(如类型、象限、中心坐标、旋转、遮挡状态和颜色,如图1及补充图S3-S81所示)。我们对2B-8B参数的领先VLM进行微调,使用Low-Rank Adaptation(LoRA)技术,并在来自我们提出的基准测试的多个域外(OD)场景中进行验证。我们的发现表明,连贯的句子式输出优于元组格式,尤其在OD场景中存在较大域间差距时效果更佳。此外,我们演示了在损失计算中扩展数值标记可进一步提升数值逼近能力,进一步提高了空间和测量任务的性能。这些结果凸显了输出格式设计、损失缩放策略以及强健泛化技术在提升VLM训练和微调方面的重要性,尤其是对于需要精确空间逼近和强OD泛化的任务。

关键词

引用

@article{arxiv.2501.15144,
  title  = {Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models},
  author = {Ankit Yadav and Lingqiao Liu and Yuankai Qi},
  journal= {arXiv preprint arXiv:2501.15144},
  year   = {2025}
}

备注

25 Pages Accepted in DICTA 2025