中文

基于多模态大语言模型的自适应引导语义增强边云协作目标检测

计算机视觉与模式识别 2025-09-25 v1 人工智能

摘要

传统目标检测方法在因缺乏高层语义理解而面临在复杂场景(如低光条件和严重遮挡)中的性能下降挑战。为此,本文提出一种基于自适应引导的语义增强边云协作目标检测方法,利用多模态大语言模型(MLLM),实现准确率与效率之间的有效平衡。具体而言,该方法首先采用指令微调使 MLLM 能够生成结构化的场景描述。随后设计了自适应映射机制,动态将语义信息转换为边缘检测器的参数调整信号,实现实时语义增强。在边缘-云协同推理框架内,系统根据置信度分数自动选择调用基于云端的语义引导或直接输出边缘检测结果。实验表明,所提方法有效提升了复杂场景中的检测准确率和效率。具体而言,在低光和高度遮挡场景中,可将延迟降低超过79%,计算成本降低70%,同时保持准确率。

关键词

引用

@article{arxiv.2509.19875,
  title  = {Adaptive Guidance Semantically Enhanced via Multimodal LLM for Edge-Cloud Object Detection},
  author = {Yunqing Hu and Zheming Yang and Chang Zhao and Wen Ji},
  journal= {arXiv preprint arXiv:2509.19875},
  year   = {2025}
}