中文

使用基础模型对群养猪只进行自动化分割与跟踪

计算机视觉与模式识别 2026-04-07 v1

摘要

基础模型(Foundation Models, FM)通过减少对特定任务监督学习的依赖并利用大规模学习到的通用视觉表征,正在重塑计算机视觉。在精准畜牧业中,大多数流程仍由需要大量标注数据、反复重训练和农场特定调优的监督学习模型主导。本研究提出一个以 FM 为中心的工作流程,用于群养保育猪的自动化监测,其中预训练的视觉-语言 FM 作为通用视觉骨干,并通过模块化后处理实现农场特定适配。首先在 1,418 张标注图像上应用 Grounding-DINO 以建立基线检测性能。虽然在日间条件下检测精度很高,但在夜视和严重遮挡下性能下降,这促使我们整合了时序跟踪逻辑。在这些检测的基础上,我们在 550 个一分钟视频片段上评估了使用 Grounded-SAM2 的短期视频分割;经过后处理,4,927 条活跃轨迹中超过 80% 完全正确,其余错误主要源于不准确的掩码或重复标签。为支持长时间的身份一致性,我们进一步开发了一个集成了初始化、跟踪、匹配、掩码细化、重识别和事后质量控制的长期跟踪流程。该系统在连续 132 分钟的视频上进行了评估,并全程保持了稳定的身份。在 132 帧均匀采样的真值帧上,系统实现了 0.83 的平均区域相似度(J)、0.92 的轮廓准确度(F)、0.87 的 J&F、0.99 的 MOTA 和 90.7% 的 MOTP,且无身份切换。总体而言,本工作展示了如何将 FM 先验知识与轻量级、特定任务的逻辑相结合,以实现猪生产中可扩展、标签高效且长时间的监测。

关键词

引用

@article{arxiv.2604.03426,
  title  = {Automated Segmentation and Tracking of Group Housed Pigs Using Foundation Models},
  author = {Ye Bi and Bimala Acharya and David Rosero and Juan Steibel},
  journal= {arXiv preprint arXiv:2604.03426},
  year   = {2026}
}