中文

面向遥感图像的视觉语言数据集生成中的度量与缓解幻觉现象

计算机视觉与模式识别 2025-01-28 v1

摘要

视觉语言模型在各个领域取得了令人印象的成绩。然而由于缺乏成对的图像-文本数据,遥感领域的应用仍有限。为弥合这一差距,合成标题生成受到关注,传统方法依赖于元数据或边界框。虽然这些方法提供了一些描述,但往往缺乏足以捕捉复杂大范围场景的深度。大语言模型(LLM)为生成更详尽的标题提供了有前景的选择,但它们容易产生通用输出且易产生幻觉。本文提出了一种新方法,通过将地图作为外部数据源集成到遥感视觉语言数据集生成中,以实现详细、充满情境的标题生成。此外,我们提出了度量和缓解 LLM 生成文本中幻觉的方法。我们引入 fMoW-mm,一个包含卫星影像、地图、元数据和文本标注的多模态数据集。我们展示了其在少样本设置下实现自动目标识别的有效性,相较于其他视觉语言遥感数据集,性能显著优于其他方法。

关键词

引用

@article{arxiv.2501.14905,
  title  = {Measuring and Mitigating Hallucinations in Vision-Language Dataset Generation for Remote Sensing},
  author = {Madeline Anderson and Miriam Cha and William T. Freeman and J. Taylor Perron and Nathaniel Maidel and Kerri Cahoy},
  journal= {arXiv preprint arXiv:2501.14905},
  year   = {2025}
}