中文

LED:无需人工生成数据的 LLM 增强开放词汇目标检测

计算机视觉与模式识别 2025-09-22 v6 人工智能

摘要

大型基础模型在大规模视觉语言数据上进行训练可通过合成训练数据提升开放词汇目标检测 (OVD),但手工制作的管道往往引入偏差并过度适应特定提示。我们规避了此问题的方法是直接将大型语言模型 (LLM) 的隐藏状态融合到检测器中——这一方法 surprisingly尚未被广泛探索。本文提出了一种系统方法,通过利用 MLLM 中 LLM 的解码器层来增强视觉 grounding。我们引入一个零初始化的跨注意力适配器,以高效地将 LLM 知识融合到目标检测器中,一种新方法称为 LED (LLM Enhanced Open-Vocabulary Object Detection)。我们发现中间 LLM 层已经编码了丰富的空间语义;仅适配早期层即可获得大部分提升。使用 Swin-T 作为视觉编码器,Qwen2-0.5B + LED 在 OmniLabel 上提升了 GroundingDINO 3.82%,仅增加 8.7% 的额外 GFLOPs;更大的视觉主干推动改进提升至 6.22%。对适配器变体、LLM 规模和融合深度进行大量消融实验进一步证实了我们的设计。

关键词

引用

@article{arxiv.2503.13794,
  title  = {LED: LLM Enhanced Open-Vocabulary Object Detection without Human Curated Data Generation},
  author = {Yang Zhou and Shiyu Zhao and Yuxiao Chen and Zhenting Wang and Can Jin and Dimitris N. Metaxas},
  journal= {arXiv preprint arXiv:2503.13794},
  year   = {2025}
}