AIVD:面向工业视觉检测的自适应边云协同
计算机视觉与模式识别
2026-01-09 v1
摘要
多模态大语言模型(MLLM)在语义理解和视觉推理方面表现卓越,但在精确对象定位和资源受限的边缘云部署方面仍面临挑战。为此,本文提出AIVD框架,通过轻量级边缘检测器与基于云端的MLLM协同,实现统一的精确定位和高质量语义生成。为增强云端MLLM对边缘裁剪框噪声和场景变异的鲁棒性,我们设计了一种高效微调策略,采用视觉-语义协同增强,显著提升分类准确率和语义一致性。 Furthermore, 为维持异构边缘设备和动态网络条件下的高吞吐量和低延迟,我们提出了一种异构资源感知的动态调度算法。实验结果表明,AIVD在显著降低资源消耗的同时,提升了MLLM的分类性能和语义生成质量。所提出的调度策略在多种场景下实现了更高的吞吐量和更低的延迟。
引用
@article{arxiv.2601.04734,
title = {AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection},
author = {Yunqing Hu and Zheming Yang and Chang Zhao and Qi Guo and Meng Gao and Pengcheng Li and Wen Ji},
journal= {arXiv preprint arXiv:2601.04734},
year = {2026}
}