灾后视觉场景理解:开放词汇 vs 监督学习方法比较评估
计算机视觉与模式识别
2026-03-03 v1
摘要
空中图像是大规模灾后损害评估的关键。自动化解释因杂乱、视觉变异性和强烈的跨事件域迁移而具有挑战性,而监督方法仍依赖于成本高昂的、针对性强的标注,且在灾难类型和区域方面覆盖有限。近期的开放词汇和基础视觉模型提供了有吸引力的替代方案,通过减少对固定标签集和大量任务特定标注的依赖,利用大规模预训练和视觉语言表示。这些属性在灾后领域尤为重要,因为视觉概念模糊且数据获取受限。在本工作中,我们对监督学习和开放词汇视觉模型进行比较评估,关注语义分割和目标检测,涵盖多个数据集,包括 FloodNet+, RescueNet, DFire, 和 LADD。我们检验了不同学习范式之间的性能趋势、失效模式和实际权衡,为实际灾难响应提供了见解。所有评估基准中最显著的发现是:监督训练仍是最可靠的方法(即当标签空间固定且标注可用时),特别是对于小目标和在杂乱场景中精细边界描绘。
引用
@article{arxiv.2603.01324,
title = {Open-Vocabulary vs Supervised Learning Methods for Post-Disaster Visual Scene Understanding},
author = {Anna Michailidou and Georgios Angelidis and Vasileios Argyriou and Panagiotis Sarigiannidis and Georgios Th. Papadopoulos},
journal= {arXiv preprint arXiv:2603.01324},
year = {2026}
}
备注
7 pages, 2 figures