中文

通过语义视觉特征匹配编码新编码器以描述暴雨图像

计算机视觉与模式识别 2025-07-03 v3

摘要

图像描述(image captioning)从输入图像生成描述场景的文本。该技术已针对晴朗天气下拍摄的高质量图像取得发展。然而,在暴雨、降雪和浓雾等恶劣天气条件下,由雨纹、雨水积聚和雪花导致的能见度低下会引起图像质量的严重退化。这阻碍了有用视觉特征的提取,并导致图像描述性能下降。为解决实际性问题,本研究引入了一种用于暴雨图像描述的新编码器。其核心思想是将从暴雨输入图像提取的输出特征转换为与词语及句子上下文相关联的语义视觉特征。为此,首先在编码器-解码器框架中训练目标编码器,以将视觉特征与语义词语相关联。随后,基于暴雨模型利用初始重建子网络(IRS)使暴雨图像中的物体显现可见。然后将 IRS 与另一语义视觉特征匹配子网络(SVFMS)相结合,以将 IRS 的输出特征与预训练目标编码器的语义视觉特征进行匹配。所提出的编码器基于 IRS 与 SVFMS 的联合学习。它以端到端方式训练,然后连接至预训练的解码器以进行图像描述。实验表明,所提出的编码器即使从暴雨图像中也能生成与词语相关联的语义视觉特征,从而提高了生成描述的准确性。

关键词

引用

@article{arxiv.2105.13753,
  title  = {New Encoder Learning for Captioning Heavy Rain Images via Semantic Visual Feature Matching},
  author = {Chang-Hwan Son and Pung-Hwi Ye},
  journal= {arXiv preprint arXiv:2105.13753},
  year   = {2025}
}