面向开放词汇的工业缺陷理解:一个大规模多模态数据集
计算机视觉与模式识别
2026-01-13 v2
摘要
我们提出了IMDD-1M,这是第一个大规模工业多模态缺陷数据集,包含1,000,000个对齐的图像-文本对,旨在推进制造与质量检测的多模态学习。IMDD-1M包含跨越60多种材料类别和400多种缺陷类型的高分辨率真实缺陷,每项均附有专家验证的标注和细粒度的文本描述,详细说明缺陷位置、严重程度和上下文属性。该数据集支持广泛的应用,包括分类、分割、检索、描述生成和生成建模。基于IMDD-1M,我们从头训练了一个针对工业场景定制的基于扩散的视觉语言基础模型。该模型作为一个可泛化的基础,可通过轻量微调高效地适应专门领域。仅需专用专家模型5%以下的任务特定数据,即可达到可比性能,突显了数据高效的基础模型适应在工业检测与生成中的潜力,为可扩展的、领域自适应的和知识驱动的制造智能铺平了道路。更多细节和资源请访问:https://ninaneon.github.io/projectpage/
引用
@article{arxiv.2512.24160,
title = {Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset},
author = {TsaiChing Ni and ZhenQi Chen and YuanFu Yang},
journal= {arXiv preprint arXiv:2512.24160},
year = {2026}
}