中文

超越 CNN:在低数据环境下多模态 LLM 对象检测的高效微调

计算机视觉与模式识别 2025-10-13 v1 人工智能

摘要

对象检测与理解的领域正快速演进,推动力来自传统 CNN 模型和新兴多模态大语言模型(LLM)。虽然 ResNet 和 YOLO 等 CNN 仍高度有效,但近期基于 transformer 的 LLM 引入了动态上下文推理、语言引导提示和整体场景理解等新能力。然而,开箱即用时,LLM 的潜力往往未被充分发挥,导致在专用视觉任务上表现次佳。本文对比了传统 CNN 的微调、零-shot 预训练多模态 LLM 和微调后的多模态 LLM 在人工文本叠加检测任务上的表现。我们的研究关键贡献在于表明 LLM 可在极少数据(不足 1000 张图片)下实现最高 36% 的准确率提升,甚至可以匹配或超越通常需要大量数据的 CNN 基线。通过探索如何用最小监督适应语言引导模型进行精准视觉理解,我们的工作为跨模态学习策略提供新见解,凸显了 LLM 在低资源视觉环境中的数据高效性和适应性。为支持后续进展,我们已在 GitHub 上公开模型微调代码。

关键词

引用

@article{arxiv.2510.08589,
  title  = {Beyond CNNs: Efficient Fine-Tuning of Multi-Modal LLMs for Object Detection on Low-Data Regimes},
  author = {Nirmal Elamon and Rouzbeh Davoudi},
  journal= {arXiv preprint arXiv:2510.08589},
  year   = {2025}
}