中文

海洋哺乳动物图像分类大语言模型基准测试

计算机视觉与模式识别 2024-10-29 v1 计算与语言

摘要

随着人工智能(AI)在过去几十年中的快速发展,在海量数据集上训练的新一代 AI——大语言模型(LLMs)——在许多应用中取得了突破性的性能。多模态 LLMs 也取得了进一步进展,创建了许多数据集来评估具有视觉能力的 LLMs。然而,这些数据集都没有仅关注海洋哺乳动物,而海洋哺乳动物对于生态平衡是不可或缺的。在这项工作中,我们构建了一个包含 65 种海洋哺乳动物的 1,423 张图像的基准数据集,其中每只动物被唯一分类到不同的类别层级,从物种级到中级再到组级。此外,我们评估了几种对这些海洋哺乳动物进行分类的方法:(1)使用神经网络提供的嵌入的机器学习(ML)算法,(2)有影响力的预训练神经网络,(3)零样本模型:CLIP 和 LLMs,以及(4)一种新颖的基于 LLM 的多智能体系统(MAS)。结果展示了传统模型和 LLMs 在不同方面的优势,并且 MAS 可以进一步提高分类性能。该数据集可在 GitHub 上获取:https://github.com/yeyimilk/LLM-Vision-Marine-Animals.git。

关键词

引用

@article{arxiv.2410.19848,
  title  = {Benchmarking Large Language Models for Image Classification of Marine Mammals},
  author = {Yijiashun Qi and Shuzhang Cai and Zunduo Zhao and Jiaming Li and Yanbin Lin and Zhiqiang Wang},
  journal= {arXiv preprint arXiv:2410.19848},
  year   = {2024}
}

备注

ICKG 2024