中文

FViG:学习灵活对象的自注意力

计算机视觉与模式识别 2024-06-28 v1 人工智能

摘要

现有计算机视觉方法主要关注刚性物体的识别,而灵活物体的识别尚未得到探索。识别灵活物体面临诸多挑战,包括其固有的形状和尺寸多样性、半透明属性、边界模糊以及细微的类别差异。在本文中,我们认为这些问题主要源于缺乏物体注意力。为此,我们提出灵活视觉图神经网络(FViG),以优化自注意力,从而提高灵活物体表征的辨识度。具体而言,我们一方面通过提取相邻节点权重来最大化通道注意力,从而适应灵活物体的形状和尺寸变化;另一方面基于聚类最大化空间注意力,以聚合邻域信息以获得质心节点,从而为表征学习引入局部上下文信息。为全面验证灵活物体识别性能,我们首次提出灵活数据集(FDA),包含来自真实场景或网络收集的多样灵活物体图像。在我们的灵活数据集上进行的大量实验表明,我们的方法在增强灵活物体辨识度方面有效。

关键词

引用

@article{arxiv.2406.18585,
  title  = {Flexible ViG: Learning the Self-Saliency for Flexible Object Recognition},
  author = {Lin Zuo and Kunshan Yang and Xianlong Tian and Kunbin He and Yongqi Ding and Mengmeng Jing},
  journal= {arXiv preprint arXiv:2406.18585},
  year   = {2024}
}

备注

under review