中文

工业语言-图像数据集 (ILID):适用于工业场景的视觉基础模型适应方法

计算机视觉与模式识别 2024-06-17 v1

摘要

近年来,大型语言模型(LLM)的上游领域也推动了计算机视觉社区致力于构建大规模多模态数据集并以自我/半监督方式进行模型训练,产生了视觉基础模型(VFM),例如对比语言-图像预训练(CLIP)。这些模型在日常物体或场景上能够很好地泛化,并在下游任务中表现卓越,甚至是在模型训练时未遇到的任务上也能表现良好。然而,在专业领域(如工业场景)中的应用仍是一个待解决的研究问题。当需要满足 adequately 的性能时,对模型进行微调或在特定领域数据上进行迁移学习是不可避免的。本文一方面引入了基于网页爬虫数据生成工业语言-图像数据集(ILID)的管道;另一方面,我们展示了在ILID上进行有效的自监督迁移学习,并讨论了在训练后进行下游任务处理,该过程无需人工标注或干预。通过提出的方法,我们通过将来自基础模型、迁移学习策略及其应用的最新研究方法引入工业领域,做出了贡献。

关键词

引用

@article{arxiv.2406.09637,
  title  = {Industrial Language-Image Dataset (ILID): Adapting Vision Foundation Models for Industrial Settings},
  author = {Keno Moenck and Duc Trung Thieu and Julian Koch and Thorsten Schüppstuhl},
  journal= {arXiv preprint arXiv:2406.09637},
  year   = {2024}
}

备注

Dataset at https://github.com/kenomo/ilid training- and evaluation-related code at https://github.com/kenomo/industrial-clip