中文

Instruct-ICL:面向灾后损毁评估的指令引导式上下文学习

计算机视觉与模式识别 2026-05-13 v1 机器学习

摘要

快速准确的情境感知对于自然灾害期间的有效响应至关重要,分析延迟会严重阻碍决策。为灾后评估训练特定任务模型通常耗时且计算成本高昂,使得此类方法在时间紧迫的场景中不切实际。因此,预训练多模态大语言模型(MLLMs)已成为灾后视觉问答(VQA)的一种有前景的替代方案,该任务旨在通过对图像和文本进行联合推理来回答关于视觉场景的结构化问题。虽然这些模型展现出强大的多模态推理能力,但其响应可能对提示词表述敏感,这可能限制它们在真实世界灾害评估场景中的可靠性。在本文中,我们研究了结构化推理策略是否可以提高预训练 MLLMs 在灾后 VQA 中的可靠性。具体来说,我们探索了多种提示范式,其中一个 MLLM 用于生成特定于任务的指令,这些指令作为第二个 MLLM 的思维链(Chain-of-Thought, CoT)引导。这些指令在答案生成过程中以不同程度的上下文学习(ICL)被整合,使模型能够同时利用显式推理引导和上下文示例。我们在 FloodNet 数据集上进行了评估,并将这些方法与零样本基线进行了比较。我们的结果表明,整合指令驱动的 CoT 推理能够持续提高答案准确性。

关键词

引用

@article{arxiv.2605.11439,
  title  = {Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment},
  author = {Armin Zarbaft and Ehsan Karimi and Nhut Le and Maryam Rahnemoonfar},
  journal= {arXiv preprint arXiv:2605.11439},
  year   = {2026}
}

备注

Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)