中文

良好表征,更好解释:卷积神经网络在基于 Transformer 的遥感图像字幕生成中的作用

计算机视觉与模式识别 2025-07-04 v2 机器学习

摘要

遥感图像字幕生成 (RSIC) 是从遥感图像生成有意义描述的过程。最近因其显著作用而受到广泛关注,采用编码器-解码器模型作为生成有意义字幕的骨架。编码器从输入图像中提取关键视觉特征,将其转化为紧凑表征;解码器则利用该表征生成连贯的文本描述。最近,基于 Transformer 的模型因其捕获长程依赖和上下文信息的能力而受到广泛热潮。解码器在文本生成方面已被充分探索,而编码器则相对未被探索。然而,优化编码器至关重要,因为它直接影响提取特征的丰富性,从而影响生成字幕的质量。为填补这一空白,本文系统评估了在基于 Transformer 的编码器框架中采用十二种不同的卷积神经网络 (CNN) 架构,以评估其在 RSIC 中的有效性。评估包含两个阶段:首先进行数值分析,将 CNN 按性能划分为不同簇;随后对表现最佳的 CNN 进行以人类视角为导向的人工评估。此外,本文分析了不同搜索策略(如贪心搜索和束搜索)对确保最佳字幕的影响。结果表明,编码器选择在提升字幕生成性能中发挥关键作用,具体的 CNN 架构显著提升了遥感图像描述的质量。通过提供多种编码器的详细比较,本研究为推动基于 Transformer 的图像字幕模型发展提供了宝贵见解。

关键词

引用

@article{arxiv.2502.16095,
  title  = {Good Representation, Better Explanation: Role of Convolutional Neural Networks in Transformer-Based Remote Sensing Image Captioning},
  author = {Swadhin Das and Saarthak Gupta and Kamal Kumar and Raksha Sharma},
  journal= {arXiv preprint arXiv:2502.16095},
  year   = {2025}
}