中文

微调 Florence2 以增强非结构化环境中的目标检测:视觉-语言模型方法

计算机视觉与模式识别 2025-04-16 v4

摘要

视觉-语言模型(VLMs)作为人工智能领域的强大工具已崭露头角,能够整合文本与视觉数据以实现对复杂场景的统一理解。尽管 Florence2 等基于 Transformer 架构的模型在通用任务中已展现出潜力,但其在非结构化或杂乱环境中的目标检测性能仍未被充分探索。本研究中,我们对 Florence2 模型进行了微调,以在非构造的复杂环境中执行目标检测任务。我们建立了全面的实验框架,涉及多种硬件配置(NVIDIA T4、L4 和 A100 GPU)、优化器(AdamW、SGD)以及多样的超参数,包括学习率和 LoRA(Low-Rank Adaptation)设置。模型训练与评估在代表真实世界无序环境的具有挑战性的数据集上进行。优化后的 Florence2 模型在目标检测精度上表现出显著提升,平均精度均值(mAP)指标接近或达到 YOLOv8、YOLOv9 和 YOLOv10 等成熟模型的水平。LoRA 的集成以及对 Transformer 层的仔细微调对这些提升做出了显著贡献。我们的发现凸显了基于 Transformer 的 VLMs(如 Florence2)在领域特定任务中的适应性,特别是在视觉复杂环境中。本研究强调了经过微调的 VLMs 在与基于卷积的传统检测器竞争方面的潜力,为先进视觉应用在真实世界非结构化环境中提供了灵活且可扩展的方法。

关键词

引用

@article{arxiv.2503.04918,
  title  = {Fine-Tuning Florence2 for Enhanced Object Detection in Un-constructed Environments: Vision-Language Model Approach},
  author = {Aysegul Ucar and Soumyadeep Ro and Sanapala Satwika and Pamarthi Yasoda Gayathri and Mohmmad Ghaith Balsha},
  journal= {arXiv preprint arXiv:2503.04918},
  year   = {2025}
}

备注

22 pages, 13 Figures, 6 Tables