释放大型语言模型的潜力:面向洪水灾害场景的零样本 VQA
计算机视觉与模式识别
2023-12-05 v1 人工智能
摘要
视觉问答 (VQA) 是一项基础且关键的 AI 任务,基于 VQA 的灾害场景理解是一个热门研究课题。例如,我们可以通过 VQA 模型对灾害图像提问,答案有助于识别是否有人或物受到灾害影响。然而,以往用于灾害损害评估的 VQA 模型存在一些不足,如候选答案空间有限、问题类型单调以及现有模型回答能力受限。在本文中,我们提出了一种名为 Zero-shot VQA for Flood Disaster Damage Assessment (ZFDDA) 的零样本 VQA 模型。它是一种无需预训练的用于损害评估的 VQA 模型。同时,以洪水灾害为主要研究对象,我们构建了一个 Freestyle Flood Disaster Image Question Answering 数据集 (FFD-IQA) 来评估我们的 VQA 模型。这一新数据集将问题类型扩展为包括自由形式、多项选择和是非题。同时,我们将以往数据集的规模扩展至共包含 2,058 张图像和 22,422 个问题-元数据真实标签对。最重要的是,我们的模型使用精心设计的思维链 (CoT) 示范来解锁大型语言模型的潜力,使得零样本 VQA 在灾害场景中展现出更好的性能。实验结果表明,使用 CoT 提示后,回答复杂问题的准确率得到大幅提升。我们的研究为后续其他灾害场景的 VQA 研究提供了研究基础。
引用
@article{arxiv.2312.01882,
title = {Unleashing the Potential of Large Language Model: Zero-shot VQA for Flood Disaster Scenario},
author = {Yimin Sun and Chao Wang and Yan Peng},
journal= {arXiv preprint arXiv:2312.01882},
year = {2023}
}
备注
accepted by The 4th International Conference on Artificial Intelligence and Computer Engineering