用于工业检测的混合视觉-语言架构自动缺陷推理与报告生成
计算机视觉与模式识别
2026-05-27 v1 人工智能
计算与语言
机器学习
摘要
自动化工业检测要求实现精确的缺陷定位和结构化维护报告的生成;当前实践中,这些任务是分开处理的,语言解释仍依赖人类专家。本文描述了一种解耦且可部署于边缘的风力发电机叶片检测管线,包含三个分别处理不同子任务的组件。Eyes 采用 YOLO26-x-obb oriented 边界框检测器在数据原生分辨率下定位缺陷。Bridge 采用无参数的确定性编码模块,将每个检测到的边界框映射为网格参考空间标记,并嵌入结构化提示。Brain 采用 4 位量化的 Qwen-2.5-1.5B 模型,通过 Quantized Low-Rank Adaptation ( QLoRA )在 947 份合成生成的维护报告上进行微调,生成来自该提示的结构化 JSON 报告。Retrieval-Augmented Fine-Tuning ( RAFT )进一步将每个建议 grounding 到索引化的维护程序。对比了该管线与单一视觉-语言模型基线以及移除单个组件的部分配置,进行五项消融实验,评估指标包括 BLEU-4、ROUGE-L、幻觉率 ( HR )以及 LLM-as-a-Judge 评分标准。完整系统实现 BLEU-4=0.41、HR=4%、专家评分=8.6/10,远超零-shot VLM 基线的 0.07、65%、3.3/10。QLoRA 微调的 1.5B 模型在相同检测证据下,优于 671B 参数的通用 API 模型,单张 T4 级 GPU 上实现 47 token/s。结果表明,针对此结构化生成任务,目的性解耦架构在小规模领域特定训练语料下,可超越通用端到端模型。
引用
@article{arxiv.2605.26533,
title = {A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection},
author = {Malikussaid and Imad Gohar},
journal= {arXiv preprint arXiv:2605.26533},
year = {2026}
}
备注
23 pages, 6 figures, 9 equations, and 6 tables