中文

面向遥感图文检索的方向导向视觉语义嵌入模型

计算机视觉与模式识别 2024-11-27 v3 人工智能

摘要

图文检索近年来发展迅速。然而,在遥感领域由于视觉-语义不平衡导致非语义视觉与文本特征的错误匹配,这仍是一项挑战。为解决该问题,我们提出一种新颖的方向导向视觉语义嵌入模型(DOVE)来挖掘视觉与语言之间的关系。我们的亮点是在潜在空间中进行视觉与文本表示,使其尽可能接近无冗余的区域视觉表示。具体而言,区域导向注意力模块(ROAM)以区域视觉特征为导向,自适应地调整潜在语义空间中最终视觉与文本嵌入之间的距离。同时,设计了一个轻量级的挖掘文本基因助手(DTGA),利用更少的注意力操作来扩展可处理的文本表示范围并增强全局词级语义连接。最终,我们利用全局视觉-语义约束来减少单一视觉依赖,并作为最终视觉与文本表示的外部约束。在 RSICD 和 RSITMD 两个基准数据集上,通过包括参数评估、定量比较、消融研究和视觉分析在内的广泛实验,验证了我们所提方法的有效性与优越性。

关键词

引用

@article{arxiv.2310.08276,
  title  = {Direction-Oriented Visual-semantic Embedding Model for Remote Sensing Image-text Retrieval},
  author = {Qing Ma and Jiancheng Pan and Cong Bai},
  journal= {arXiv preprint arXiv:2310.08276},
  year   = {2024}
}

备注

14 pages, 12 figures