中文

FishDetector-R1:基于统一多模态大语言模型的强化微调框架用于弱监督下的鱼类检测、分割和计数

计算机视觉与模式识别 2025-12-09 v1 计算机与社会 机器人学 图像与视频处理

摘要

分析水下鱼类图像对于生态监测至关重要,但由于视觉退化和昂贵的标注,仍然困难。我们引入FishDetector-R1,一个基于多模态大语言模型的统一框架,用于弱监督下的鱼类检测、分割和计数。在DeepFish数据集上,我们的框架在基线方法上实现了显著提升,使平均精度(AP)提高20%,平均交并比(mIoU)提高10%,同时将平均绝对误差(MAE)降低30%,GAME降低35%。这些改进源于两个关键组件:一种新颖的检测到计数提示,用于强制检测和计数在空间上一致,以及基于可验证奖励的强化学习(RLVR),该方法采用稀疏点标签的补充可扩展范式。消融研究进一步验证了这种奖励设计的有效性。此外,改进在其他水下数据集上也能很好地泛化,确认了强大的跨域鲁棒性。总体而言,FishDetector-R1为通过弱监督实现准确的海洋视觉理解提供了一个可靠且可扩展的解决方案。FishDetector-R1的项目页面为https://umfieldrobotics.github.io/FishDetector-R1。

关键词

引用

@article{arxiv.2512.05996,
  title  = {FishDetector-R1: Unified MLLM-Based Framework with Reinforcement Fine-Tuning for Weakly Supervised Fish Detection, Segmentation, and Counting},
  author = {Yi Liu and Jingyu Song and Vedanth Kallakuri and Katherine A. Skinner},
  journal= {arXiv preprint arXiv:2512.05996},
  year   = {2025}
}

备注

18 pages, under review