中文

VLM4Bio:用于评估预训练视觉语言模型在生物图像特征发现中的基准数据集

计算机视觉与模式识别 2024-08-30 v1

摘要

图像正日益成为记录地球生物多样性的货币,为加速有机生物学领域的科学发现提供了新的机遇,尤其是以大型视觉语言模型(VLM)为佳。我们探讨了预训练VLM是否能在无需额外微调的情况下帮助科学家回答一系列与生物学相关的问题。本文使用由VLM4Bio数据集组成的新型数据集,评估了12种最先进(SOTA)VLM在有机生物学领域的效果。该数据集包含46.9万个问答对,涉及3万张来自三类生物组织(鱼类、鸟类和蝴蝶)的图像,覆盖五项与生物学相关的任务。我们还探讨了应用提示技术对VLM性能的影响,并对其在使用图像回答生物学相关问题方面的能力进行了测试,为当前SOTA VLM的能力提供了新的视角。本文所报告的所有分析的代码和数据集可在https://github.com/sammarfy/VLM4Bio上获得。

关键词

引用

@article{arxiv.2408.16176,
  title  = {VLM4Bio: A Benchmark Dataset to Evaluate Pretrained Vision-Language Models for Trait Discovery from Biological Images},
  author = {M. Maruf and Arka Daw and Kazi Sajeed Mehrab and Harish Babu Manogaran and Abhilash Neog and Medha Sawhney and Mridul Khurana and James P. Balhoff and Yasin Bakis and Bahadir Altintas and Matthew J. Thompson and Elizabeth G. Campolongo and Josef C. Uyeda and Hilmar Lapp and Henry L. Bart and Paula M. Mabee and Yu Su and Wei-Lun Chao and Charles Stewart and Tanya Berger-Wolf and Wasila Dahdul and Anuj Karpatne},
  journal= {arXiv preprint arXiv:2408.16176},
  year   = {2024}
}

备注

36 pages, 37 figures, 7 tables