使用视觉语言模型消除制造数据集标签中的噪声
计算机视觉与模式识别
2025-07-01 v1 人工智能
摘要
机器学习模型在工业应用中的成功程度严重依赖于用于训练模型的数据集质量。然而,大规模数据集,尤其是那些由众包和网页抓取构建的数据集,常常 suffer from 标签噪声、不一致和错误。这个问题在制造领域尤为突出,因为获得高质量标签成本高昂且耗时。本文引入了基于视觉语言的标签消除与细化框架(Vision-Language Sanitization and Refinement, VLSR),用于多标签制造图像数据集的标签消除与细化。该方法利用 CLIP 视觉语言模型将图像及其关联文本标签嵌入到共享的语义空间。随后通过计算嵌入之间的余弦相似性来完成两个关键任务。首先,通过计算图像与标签嵌入之间的余弦相似性来进行标签消除,以识别无关、拼写错误或语义弱的标签,并揭示与每张图像最语义一致的标签。其次,该方法对文本嵌入应用基于密度的聚类,随后进行迭代聚类合并,以将语义相似的标签分组整合。采用包括来自人工标注和网页抓取来源的噪声标签的 Factorynet 数据集用于评估所提出框架的有效性。实验结果表明,VLSR 框架成功识别了有问题的标签,并提高了标签的一致性。该方法通过聚类显著减少了标签词汇表,从而提高了在最小人工干预的情况下为工业应用中健壮机器学习模型训练提供数据集质量。
引用
@article{arxiv.2506.23465,
title = {Sanitizing Manufacturing Dataset Labels Using Vision-Language Models},
author = {Nazanin Mahjourian and Vinh Nguyen},
journal= {arXiv preprint arXiv:2506.23465},
year = {2025}
}