Think First, Assign Next(ThiFAN-VQA):面向后灾害损害评估的两阶段链式思考框架
计算机视觉与模式识别
2025-11-26 v1 人工智能
机器学习
摘要
及时和准确评估自然灾害后的损害对于有效的紧急响应和恢复至关重要。近期开发了许多基于人工智能的框架来分析由无人机收集的大量航空图像,提供快速可操作的见解。然而,为训练这些模型创建和注释数据的成本高昂且耗时,导致数据集在规模和多样性方面有限。此外,大多数现有方法依赖于具有固定答案空间的传统分类框架,这限制了其在无需额外数据收集或模型重新训练的情况下提供新信息的能力。使用基于原语学习(ICL)的预训练生成模型允许灵活且开放的答案空间。然而,这些模型常生成幻觉输出或产生通用响应,缺乏领域特定的相关性。为克服这些限制,我们提出了 ThiFAN-VQA,一个用于灾害场景下视觉问答(VQA)的两阶段推理框架。ThiFAN-VQA 首先通过链式思考(CoT)提示和 ICL 生成结构化的推理痕迹,以实现受限监督下的可解释推理。随后的答案选择模块评估生成的响应并分配最具连贯性和情境准确性的答案,有效提高模型性能。通过集成自定义信息检索系统、领域特定提示和以推理为导向的答案选择,ThiFAN-VQA 弥合了零样本方法和监督方法之间的差距,实现了灵活性与一致性的结合。在 FloodNet 和 RescueNet-VQA 上进行的实验表明,ThiFAN-VQA 在实际后灾害损害评估任务中实现了卓越的准确率、可解释性和适应性。
引用
@article{arxiv.2511.19557,
title = {Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment},
author = {Ehsan Karimi and Nhut Le and Maryam Rahnemoonfar},
journal= {arXiv preprint arXiv:2511.19557},
year = {2025}
}