ChatGPT 与通用 AI 在图像果实计数中表现出惊人的效果
计算机视觉与模式识别
2024-04-15 v1 图像与视频处理
摘要
目标计数是各个领域深度学习应用中的热门任务,包括农业。传统的深度学习方法需要大量训练数据,这在实际应用中往往是一个后勤问题。为了解决这个问题,我们研究了 ChatGPT (GPT4V) 和一种通用 AI(用于目标计数的基础模型,T-Rex)在 100 张图像中计算果实实体(咖啡樱桃)数量的能力。具有少样本学习的基础模型优于经过训练的 YOLOv8 模型(R2 分别为 0.923 和 0.900)。ChatGPT 也展现出了一些有趣的潜力,特别是当应用带有人类反馈的少样本学习时(R2 分别为 0.360 和 0.460)。此外,作为一个实际问题,我们考察了实现所需的时间。使用基础模型和 ChatGPT 获得结果的时间远短于 YOLOv8 模型(0.83 小时、1.75 小时和 161 小时)。我们将这些结果解读为应用领域深度学习用户的两个惊喜:具有少样本特定领域学习的基础模型与传统方法相比可以大幅节省时间和精力,而 ChatGPT 可以展现出相对较好的性能。这两种方法都不需要编程技能,这可以促进 AI 的教育和普及。
引用
@article{arxiv.2404.08515,
title = {ChatGPT and general-purpose AI count fruits in pictures surprisingly well},
author = {Konlavach Mengsuwan and Juan Camilo Rivera Palacio and Masahiro Ryo},
journal= {arXiv preprint arXiv:2404.08515},
year = {2024}
}
备注
12 pages, 3 figures