中文

大型视觉语言模型中的形状与纹理识别

计算机视觉与模式识别 2025-12-10 v5

摘要

形状和纹理是视觉感知的基本构建块。无论方向、纹理或上下文如何都能识别形状,以及独立于其关联对象识别纹理和材料的能力,对于全面理解世界至关重要。本工作引入了大型形状与纹理数据集(LAS&T),这是一个包含高度多样化形状和纹理的庞大集合,通过无监督地从自然图像中提取模式创建而成。该数据集用于基准测试领先的大型视觉语言模型(LVLM/VLM)在 2D 和 3D 场景中识别和表示形状、纹理和材料的有效性。对于形状识别,我们测试了模型匹配在方向、纹理、颜色或环境上存在差异的相同形状图像的能力。我们的结果表明,LVLMs 的形状识别能力仍远低于人类水平,尤其是在应用多种变换时。LVLMs 主要依赖高级和语义特征,在处理缺乏类别关联的抽象形状时存在困难。对于纹理和材料识别,我们评估了模型在不同对象和环境中识别具有相同纹理和材料的图像的能力。有趣的是,领先的 LVLMs 在识别 3D 场景中的材料方面接近人类水平,但在识别更简单、更抽象的 2D 纹理和形状时则大幅落后于人类。这些结果在广泛的领先 LVLMs(GPT/Gemini/LLama/Qwen)和基础视觉模型(DINO/CLIP)中保持一致,暴露了 VLMs 在提取低级视觉特征能力方面的重大缺陷。相比之下,人类和直接针对这些任务训练的简单网络实现了高准确率。LAS&T 数据集包含超过 700,000 张用于 2D/3D 形状和纹理识别与检索的图像,现已免费提供。

关键词

引用

@article{arxiv.2503.23062,
  title  = {Shape and Texture Recognition in Large Vision-Language Models},
  author = {Sagi Eppel and Mor Bismut and Alona Faktor-Strugatski},
  journal= {arXiv preprint arXiv:2503.23062},
  year   = {2025}
}