减少幻觉:利用视觉上下文增强用于洪水灾害损害评估的视觉问答
计算机视觉与模式识别
2023-12-22 v1
摘要
视觉问答模型的零样本性能严重依赖提示。例如,针对灾害场景的零样本 VQA 可以利用精心设计的思维链提示来激发模型的潜力。然而,使用 CoT 提示存在一些问题,例如由于思维过程中的幻觉最终导致错误答案。在本文中,我们提出了一种名为具有两阶段提示的洪水灾害 VQA (Flood Disaster VQA with Two-Stage Prompt, VQA-TSP) 的零样本 VQA。该模型在第一阶段生成思维过程,然后在第二阶段使用该思维过程生成最终答案。特别地,在第二阶段中加入视觉上下文,以缓解思维过程中存在的幻觉问题。实验结果表明,我们的方法在总体上超越了最先进的零样本 VQA 模型在洪水灾害场景下的性能。我们的研究为提高基于 CoT 的零样本 VQA 性能提供了研究基础。
引用
@article{arxiv.2312.13848,
title = {Reducing Hallucinations: Enhancing VQA for Flood Disaster Damage Assessment with Visual Contexts},
author = {Yimin Sun and Chao Wang and Yan Peng},
journal= {arXiv preprint arXiv:2312.13848},
year = {2023}
}
备注
already be accepted by 2024 3rd International Conference on Computer, Artificial Intelligence and Control Engineering (CAICE 2024)