中文

FishNet++: 分析多模态大语言模型在海洋生物学中的能力

计算机视觉与模式识别 2025-10-01 v1

摘要

多模态大语言模型(MLLMs)在跨领域任务中展现出惊人的能力,但其在专业科学领域如海洋生物学中的熟练程度仍未得到充分探索。本文系统评估了最先进的 MLLMs,揭示了其在鱼类精细识别方面存在显著局限,最佳开源模型的准确率不足10%。该任务对于监测受人类活动影响下的海洋生态系统至关重要。为弥补这一差距并探讨这些失败是否源于缺乏领域知识,本文引入了 FishNet++,一个大规模多模态基准数据集。FishNet++显著扩展了现有资源,包含35,133个文本描述用于多模态学习、706,426个关键点注释用于形态学研究,以及119,399个边界框用于检测。通过提供这一全面的注释套件,我们的工作促进了开发和评估专门的视觉语言模型,以推动水生科学的发展。

关键词

引用

@article{arxiv.2509.25564,
  title  = {FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology},
  author = {Faizan Farooq Khan and Yousef Radwan and Eslam Abdelrahman and Abdulwahab Felemban and Aymen Mir and Nico K. Michiels and Andrew J. Temple and Michael L. Berumen and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2509.25564},
  year   = {2025}
}

备注

3 figures 8 tables