AgroGPT:面向农业领域的高效视觉语言模型与专家调优
计算机视觉与模式识别
2025-01-10 v2 人工智能
摘要
在推动大型多模态对话模型(LMM)方面取得了显著进展,利用了在线上可获取的庞大图像-文本数据。尽管如此,这些模型常常遇到显著的领域差距,阻碍其在新领域进行复杂对话。最近的努力试图缓解这一问题,尽管依赖于特定领域的图像-文本数据来精选调优数据。然而,许多领域,如农业领域,缺乏此类视觉-语言数据。本文提出了一种方法,通过利用农业领域的视觉数据构建指令调优数据。我们利用跨越多个领域的多样化农业数据集,策划特定类别的信息,并采用大语言模型(LLM)构建一个名为AgroInstruct的70k规模的专家调优数据集。随后,我们对AgroGPT进行专家调优,构建一个能够进行复杂农业相关对话并提供有用见解的高效LMM。我们还开发了AgroEvals用于评估,并将{AgroGPT的}性能与大型开源和闭源模型进行比较。{AgroGPT}在识别细粒度农业概念方面表现出色,可以作为农业专家,为多模态农业问题提供有用的信息。代码、数据集和模型均已在https://github.com/awaisrauf/agroGPT 上提供。
引用
@article{arxiv.2410.08405,
title = {AgroGPT: Efficient Agricultural Vision-Language Model with Expert Tuning},
author = {Muhammad Awais and Ali Husain Salem Abdulla Alharthi and Amandeep Kumar and Hisham Cholakkal and Rao Muhammad Anwer},
journal= {arXiv preprint arXiv:2410.08405},
year = {2025}
}
备注
Accepted at WACV, 2025