基于场景感知的增强边云协同工业视觉检查框架:多模态大语言模型
计算机视觉与模式识别
2025-09-23 v1 人工智能
摘要
工业视觉检查需在严格的资源约束下实现高精度,但现有方法面临根本性权衡。多模态大语言模型(MLLM)具备强大的推理能力,但计算成本高昂;而轻量级边缘模型在复杂场景下常常失效。本文提出SAEC(Scene-Aware Enhanced Edge-Cloud Collaborative Industrial Vision Inspection,场景感知增强边云协同工业视觉检查)框架,结合MLLM构建边云协同的工业视觉检查系统。该框架由三个协同组件构成:(1)复杂缺陷检测的高效MLLM微调、(2)轻量化多尺度场景复杂度估计、(3)自适应边云调度器。通过针对场景复杂度进行多模态推理调节,并动态平衡边缘与云端资源,实现对缺陷的稳健检测。实验在MVTec AD和KSDD2数据集上表明,SAEC准确率分别达到85.11%和82.72%,相较Qwen提升22.1%和20.8%,相较LLaVA提升33.3%和31.6%。运行时长最高可降低22.4%,单位正确决策能耗降低40%至74%。代码已公开于https://github.com/YuHao-Tian/SAEC。
引用
@article{arxiv.2509.17136,
title = {SAEC: Scene-Aware Enhanced Edge-Cloud Collaborative Industrial Vision Inspection with Multimodal LLM},
author = {Yuhao Tian and Zheming Yang},
journal= {arXiv preprint arXiv:2509.17136},
year = {2025}
}
备注
5 pages, 5 figures