中文

利用视觉语言模型融合图像与人类知识的有效损伤数据生成

计算机视觉与模式识别 2025-08-05 v1 人工智能

摘要

在人道主义援助和灾后响应(HADR)中迅速准确评估损伤至为重要。当前的深度学习方法由于数据类别不平衡、中等损伤样本稀缺以及在HADR情境下人类像素标注不准确等问题难以有效泛化。为弥补这些限制并利用视觉语言模型(VLMs)将图像与人类知识理解相融合,有机会有效地生成多样化的图像基损伤数据。我们的初始实验结果表明,数据生成质量值得期待,显示在分类建筑物、道路和基础设施不同结构损伤程度的场景方面取得了改进。

关键词

引用

@article{arxiv.2508.01380,
  title  = {Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models},
  author = {Jie Wei and Erika Ardiles-Cruz and Aleksey Panasyuk and Erik Blasch},
  journal= {arXiv preprint arXiv:2508.01380},
  year   = {2025}
}

备注

6 pages, IEEE NAECON'25