中文

基于基础模型的零样态与监督鸟类图像分割:双管线方法结合 Grounding DINO 1.5、YOLOv11 与 SAM 2.1

计算机视觉与模式识别 2026-03-11 v2 人工智能

摘要

鸟类图像分割是计算机视觉中的一个具有挑战性的任务,由于极端姿态多样性、复杂羽毛纹样以及变化的光照条件。本文提出一种基于 2025 年基础模型的双管线框架,用于二值鸟类图像分割。我们引入两种运行模式,基于 Segment Anything Model 2.1 (SAM 2.1) 作为共享冻结主干网络:(1) 零样态管线使用 Grounding DINO 1.5 通过文本提示“bird”检测鸟类,再使用边界框为 SAM 2.1 提供提示,无需标记鸟类数据;(2) 监督管线在 CUB-200-2011 数据集上微调 YOLOv11 以实现高精度检测,同样使用边界框为 SAM 2.1 提供提示进行像素级掩码分割。分割模型无需为新物种或新域重新训练。在 CUB-200-2011 (11,788 张图像,200 个物种) 上,监督管线实现 IoU 0.912、Dice 0.954 和 F1 0.953,超越所有先前基线(包括 SegFormer-B2 的 IoU 0.842,提升 7.0 个百分点)。零样态管线仅通过文本提示实现 IoU 0.831,这是该基准首次报告的结果。我们展示,基于提示的基础模型管线在不特定任务端到端训练的分割网络中表现更佳,仅需轻量级检测器微调约 1 小时即可实现领域适应。完整的 PyTorch 实现、数据集准备脚本和训练权重已公开。

关键词

引用

@article{arxiv.2603.00184,
  title  = {Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1},
  author = {Abhinav Munagala},
  journal= {arXiv preprint arXiv:2603.00184},
  year   = {2026}
}