利用视觉语言模型融合图像与人类知识的有效损伤数据生成
计算机视觉与模式识别
2025-08-05 v1 人工智能
摘要
在人道主义援助和灾后响应(HADR)中迅速准确评估损伤至为重要。当前的深度学习方法由于数据类别不平衡、中等损伤样本稀缺以及在HADR情境下人类像素标注不准确等问题难以有效泛化。为弥补这些限制并利用视觉语言模型(VLMs)将图像与人类知识理解相融合,有机会有效地生成多样化的图像基损伤数据。我们的初始实验结果表明,数据生成质量值得期待,显示在分类建筑物、道路和基础设施不同结构损伤程度的场景方面取得了改进。
引用
@article{arxiv.2508.01380,
title = {Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models},
author = {Jie Wei and Erika Ardiles-Cruz and Aleksey Panasyuk and Erik Blasch},
journal= {arXiv preprint arXiv:2508.01380},
year = {2025}
}
备注
6 pages, IEEE NAECON'25