中文

面向图像描述中的局部视觉建模

计算机视觉与模式识别 2023-02-14 v1 多媒体

摘要

本文研究利用网格特征进行图像描述的局部视觉建模,这对于生成准确且详尽的描述至关重要。为实现这一目标,我们提出一种具有两种新颖设计的局部敏感Transformer网络(LSTNet),即局部敏感注意力(LSA)与局部敏感融合(LSF)。LSA部署于Transformer的层内交互,通过建模每个网格与其邻域的关系实现。它降低了描述过程中局部物体识别的难度。LSF用于层间信息融合,聚合不同编码器层的信息以实现跨层语义互补。凭借这两种新颖设计,所提出的LSTNet能够建模网格特征的局部视觉信息以提升描述质量。为验证LSTNet,我们在具有竞争力的MS-COCO基准上进行了大量实验。实验结果表明,LSTNet不仅能进行局部视觉建模,还在离线与在线测试中优于众多最先进的描述模型,即分别达到134.8 CIDEr与136.3 CIDEr。此外,LSTNet的泛化性也在Flickr8k与Flickr30k数据集上得到验证。

关键词

引用

@article{arxiv.2302.06098,
  title  = {Towards Local Visual Modeling for Image Captioning},
  author = {Yiwei Ma and Jiayi Ji and Xiaoshuai Sun and Yiyi Zhou and Rongrong Ji},
  journal= {arXiv preprint arXiv:2302.06098},
  year   = {2023}
}

备注

Preprint