中文

昆虫-Foundation:面向视觉-语言昆虫理解的基础模型与大型多模态数据集

计算机视觉与模式识别 2025-02-17 v1

摘要

多模态对话生成人工智能在各种视觉和语言理解任务中展现出惊人的能力,主要通过学习大规模文本-图像数据来实现。然而,当前的对话模型仍缺乏关于视觉昆虫的知识,因为它们通常在通用视觉-语言数据上进行训练。同时,理解昆虫是精密农业的基本问题,有助于推动农业的可持续发展。因此,本文提出一种新型多模态对话模型Insect-LLaVA,以促进昆虫领域知识的视觉理解。具体而言,我们首先引入新的大型多模态昆虫数据集,包含视觉昆虫指令数据,使模型能够学习多模态基础模型。我们提出的数据集使对话模型能够理解昆虫的视觉和语义特征。其次,我们提出了新的Insect-LLaVA模型,即视觉昆虫理解领域的全新大型语言和视觉助手。为增强学习昆虫特征的能力,我们开发了基于Patch-wise Relevant Attention机制的新型微观特征自监督学习方法,以捕捉昆虫图像之间的细微差异。我们还提出描述一致性损失,以通过文本描述改进微观特征学习。在我们的新视觉昆虫问答基准测试上进行的实验结果表明,我们的方法在视觉昆虫理解方面表现有效,并在标准的昆虫相关任务基准上实现了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2502.09906,
  title  = {Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding},
  author = {Thanh-Dat Truong and Hoang-Quan Nguyen and Xuan-Bac Nguyen and Ashley Dowling and Xin Li and Khoa Luu},
  journal= {arXiv preprint arXiv:2502.09906},
  year   = {2025}
}