卫星图像描述生成:利用大语言模型增强标注
机器学习
2023-12-19 v1 计算与语言
计算机视觉与模式识别
摘要
随着现代目标检测网络及其训练数据集能力的不断增强,上手并运行一个擅长检测任意多种目标的模型变得更加直接,且重要的是,更加省力。然而,尽管用于目标检测的图像数据集不断增长并持续激增(目前最大的公开数据集 ImageNet 包含超过 1400 万张图像和超过 1400 万个实例),但文本描述数据集的情况却并非如此。虽然近年来描述数据集确实在不断增长,但由于语言差异、语法以及人类生成描述所需的时间,描述数据集带来了更大的挑战。当前的数据集确实提供了许多可用的实例,但当描述者的词汇量可能较有限、可能对语言不够流利或存在简单的语法错误时,就会出现问题。当图像变得更加特定(例如遥感图像)时,这些困难就会增加。本文旨在解决描述数据集中潜在的信息和沟通缺陷问题。为了提供更精确的分析,我们将图像领域限定为 RSICD 数据集中的遥感图像,并对其中提供的描述进行实验。我们的研究结果表明,ChatGPT 语法纠正是提高描述模型性能准确度的一种简单有效的方法,它通过使数据描述更加多样化和语法正确来实现。
引用
@article{arxiv.2312.10905,
title = {Satellite Captioning: Large Language Models to Augment Labeling},
author = {Grant Rosario and David Noever},
journal= {arXiv preprint arXiv:2312.10905},
year = {2023}
}
备注
9 pages, 4 figures, 4 tables