面向工业轮廓检测的生成式 AI:一种语言引导的视觉系统
计算机视觉与模式识别
2025-09-03 v1 人工智能
摘要
工业计算机视觉系统常面临噪声、材料可变性和不可控的成像条件,限制了经典边缘检测器和手工制作管道的效果。在本工作中,我们提出了一种面向制造业残余轮廓检测的语言引导生成视觉系统,旨在实现 CAD 级别的精度。该系统分为三个阶段:数据获取和预处理、使用条件 GAN 的轮廓生成,以及通过视觉-语言建模实现多模态轮廓细化,其中通过人类在环过程制作标准化提示并通过图像-文本引导合成应用。我们在专有的 FabTrack 数据集上,该系统改进了轮廓保真度,增强了边缘连续性和几何对齐,同时减少了手动跟踪。对于细化阶段,我们对比测试了几种视觉-语言模型,包括 Google 的 Gemini 2.0 Flash、OpenAI 的 GPT-image-1 集成在 VLM 引导的工作流程中以及开源基线。在标准化条件下,GPT-image-1 在结构准确性和感知质量方面 consistently 超过 Gemini 2.0 Flash。这些发现表明,VLM 引导的生成式工作流程为超越经典管道的局限性具有巨大的潜力。
引用
@article{arxiv.2509.00284,
title = {Generative AI for Industrial Contour Detection: A Language-Guided Vision System},
author = {Liang Gong and Tommy and Wang and Sara Chaker and Yanchen Dong and Fouad Bousetouane and Brenden Morton and Mark Mendez},
journal= {arXiv preprint arXiv:2509.00284},
year = {2025}
}
备注
20 pages, 5 figures