中文

面料检索的视觉语言模型分析

计算机视觉与模式识别 2025-07-08 v1

摘要

有效的跨模态检索对于信息检索和推荐系统等应用至关重要,尤其是在制造业等专业领域,产品信息通常由视觉样本配合文本描述。本文研究了利用视觉语言模型(Vision Language Models, VLMs)进行面料样本的零样本文本到图像检索。我们解决了公开数据集匮乏的问题,通过引入基于多模态大语言模型(Multimodal Large Language Models, MLLMs)的自动标注管道,生成两种类型的文本描述:自由形式的自然语言和结构化的属性描述。我们生成这些描述来评估跨三个视觉语言模型(CLIP、LAION-CLIP和Meta的感知编码器,Perception Encoder)的检索性能。我们的实验表明,结构化且富有属性的描述显著提升了检索准确性,尤其是对于视觉复杂的面料类别,感知编码器由于其稳健的特征对齐能力而表现出色。然而,在细粒度领域中,零样本检索仍然具有挑战性,这凸显了需要领域适应方法的必要性。我们的发现突显了将技术性文本描述与先进VLMs结合以优化工业应用中的跨模态检索的重要性。

关键词

引用

@article{arxiv.2507.04735,
  title  = {An analysis of vision-language models for fabric retrieval},
  author = {Francesco Giuliari and Asif Khan Pattan and Mohamed Lamine Mekhalfi and Fabio Poiesi},
  journal= {arXiv preprint arXiv:2507.04735},
  year   = {2025}
}

备注

Accepted at Ital-IA 2025