学习评估多模态语义定位的性能
计算机视觉与模式识别
2022-09-20 v3 多媒体
摘要
语义定位(SeLo)是指利用文本等语义信息在大规模遥感(RS)图像中获取最相关位置的任务。作为一项基于跨模态检索的新兴任务,SeLo仅使用描述级标注即可实现语义级检索,展现了其在统一下游任务方面的巨大潜力。尽管SeLo已相继开展,但目前尚无工作对该紧迫方向进行系统探索与分析。本文深入研究了该领域,并从指标与测试数据方面提供了完整的基准以推进SeLo任务。首先,基于该任务特性,我们提出多个判别性评估指标来量化SeLo任务的性能。所设计的显著区域比例、注意力偏移距离和离散注意力距离用于从像素级和区域级评估生成的SeLo图。接下来,为SeLo任务提供标准评估数据,我们贡献了一个多样、多语义、多目标的语义定位测试集(AIR-SLT)。AIR-SLT由22幅大规模RS图像和59个具有不同语义的测试用例组成,旨在为检索模型提供全面评估。最后,我们详细分析了RS跨模态检索模型的SeLo性能,探讨了不同变量对该任务的影响,并提供了SeLo任务的完整基准。我们还建立了RS指代表达理解的新范式,并通过将其与检测、道路提取等任务结合,展示了SeLo在语义方面的巨大优势。所提出的评估指标、语义定位测试集及相应脚本已开源,访问地址为github.com/xiaoyuan1996/SemanticLocalizationMetrics。
引用
@article{arxiv.2209.06515,
title = {Learning to Evaluate Performance of Multi-modal Semantic Localization},
author = {Zhiqiang Yuan and Wenkai Zhang and Chongyang Li and Zhaoying Pan and Yongqiang Mao and Jialiang Chen and Shouke Li and Hongqi Wang and Xian Sun},
journal= {arXiv preprint arXiv:2209.06515},
year = {2022}
}
备注
19 pages, 11 figures