语义-空间特征融合与动态图 refinements 用于遥感图像描述生成
计算机视觉与模式识别
2025-04-01 v1
摘要
遥感图像描述生成旨在生成与遥感图像视觉特征紧密相关的语义准确描述。现有方法通常强调对视觉特征的细粒度提取和捕获全局信息,但往往忽视文本信息在增强视觉语义中的互补作用,且面临精确定位与图像上下文最相关对象的挑战。为此,本文提出一种语义-空间特征融合与动态图 refinement (SFDR) 方法,集成语义-空间特征融合 (SSFF) 和动态图特征 refinement (DGFR) 两个模块。SSFF 模块通过利用预训练 CLIP 特征、网格特征和 ROI 特征,实现对丰富语义与空间信息的集成。在 DGFR 模块中,图注意力网络捕获特征节点之间的关系,动态加权机制优先考虑当前场景中最相关的对象,抑制不重要的因素。因此,本文提出的 SFDR 方法显著提升了生成描述的质量。在三个基准数据集上的实验结果表明,所提方法有效。源代码将在 https://github.com/zxk688 可用。
引用
@article{arxiv.2503.23453,
title = {Semantic-Spatial Feature Fusion with Dynamic Graph Refinement for Remote Sensing Image Captioning},
author = {Maofu Liu and Jiahui Liu and Xiaokang Zhang},
journal= {arXiv preprint arXiv:2503.23453},
year = {2025}
}