拼接与说:面向空间理解的结构化多模态数据增强方法
计算机视觉与模式识别
2025-12-16 v1 人工智能
摘要
现有的视觉语言模型常常出现空间幻觉,即生成关于图像中物体相对位置不正确的描述。我们认为这一问题主要源于图像和文本之间的非对称性。为丰富视觉语言模型的空间理解能力,我们提出一种简单、无需标注、即插即用的方法,名为 (缩写为 SiTe),通过向数据中注入结构化的空间监督来实现。该方法通过在空间轴上拼接图像,并基于拼接图像的布局生成具有空间感知能力的标题或问答对,构建拼接的图像-文本对,无需依赖昂贵的高级模型或人工参与。我们在包括 LLaVA-v1.5-7B、LLaVA-Qwen2-1.5B 和 HALVA-7B 在内的三个架构、两个训练数据集和八个基准测试上对 SiTe 进行评估。实验表明,SiTe 在诸如 (+5.50%) 和 Spatial-MM (+4.19%) 等空间理解任务上实现改进,同时在 COCO-QA (+1.02%) 和 MMBench (+4.76%) 等通用视觉语言基准测试中保持或提升性能。我们的发现表明,显式地将具有空间感知结构注入训练数据是缓解空间幻觉、提升空间理解能力而又能保持通用视觉语言能力的有效方法。
引用
@article{arxiv.2512.06769,
title = {Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding},
author = {Hang Yin and Xiaomin He and PeiWen Yuan and Yiwei Li and Jiayi Shi and Wenxiao Fan and Shaoxiong Feng and Kan Li},
journal= {arXiv preprint arXiv:2512.06769},
year = {2025}
}