ZeShot-VQA:面向自然灾害损害评估的基于答案映射的零样本视觉问答框架
计算机视觉与模式识别
2025-12-10 v1 计算与语言
信息检索
机器学习
摘要
自然灾害通常影响广阔区域并摧毁基础设施。进行及时高效的响应对于最大程度减少对受灾社区的影响至关重要,而数据驱动的方法是最佳选择。视觉问答(VQA)模型帮助管理团队深入理解损害情况。然而,近期发表的模型不具备回答开放式问题的能力,只能在预定义的答案列表中选择最佳答案。如果我们想提出包含预定义列表中不存在的新增可能答案的问题,模型需要在新收集并标注的数据集上进行微调或重新训练,这是一个耗时的过程。近年来,大规模视觉语言模型(VLMs)受到了广泛关注。这些模型在广泛的数据集上训练,在单模态和多模态视觉/语言下游任务中均表现出色,且通常无需微调。在本文中,我们提出了一种基于 VLM 的零样本 VQA(ZeShot-VQA)方法,并研究了其在灾后 FloodNet 数据集上的性能。由于所提出的方法利用了零样本学习,它可以在无需微调的情况下应用于新数据集。此外,ZeShot-VQA 能够处理并生成在训练过程中未见过的答案,这展示了其灵活性。
引用
@article{arxiv.2506.00238,
title = {ZeShot-VQA: Zero-Shot Visual Question Answering Framework with Answer Mapping for Natural Disaster Damage Assessment},
author = {Ehsan Karimi and Maryam Rahnemoonfar},
journal= {arXiv preprint arXiv:2506.00238},
year = {2025}
}
备注
Accepted by the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025)