中文

自适应掩码提升视觉定位

人工智能 2024-10-07 v1

摘要

近年来,零样本和少样本视觉定位研究受到广泛关注,主要due于在大规模数据集(如 LAION-5B 和 DataComp-1B)上的大规模视觉语言预训练取得的成功。然而,这些数据集的持续扩张带来了显著挑战,尤其是数据可获取性和计算开销方面,成为限制低样本学习能力发展的瓶颈。本文提出了 IMAGE 方法,即 Interpreative MAsking with Gaussian radiation modEming,旨在无需增加数据集规模的情况下提升零样本和少样本学习场景下的词汇定位效果。我们受认知科学及掩码自编码器(MAE)的最新进展启发,利用自适应掩码对视觉主干网络生成的特征图中显著区域进行掩码处理,使模型能够通过重建被遮挡信息来学习鲁棌且通用的表征,从而有效地注意力于局部和全局特征。我们在包含 COCO 和 ODinW 在内的基准数据集上评估了该方法的有效性,证明其在零样本和少样本任务中表现优异。实验结果一致显示,IMAGE 超越了基线模型,实现了更好的泛化性并在低样本场景中取得 improved 性能。这些发现表明,通过注意力机制和高斯建模进行自适应特征操控,作为一种不依赖不断扩大数据集规模来推动零样本和少样本学习发展的有前景的替代方法。我们的代码已公开于 https://github.com/git-lenny/IMAGE。

关键词

引用

@article{arxiv.2410.03161,
  title  = {Adaptive Masking Enhances Visual Grounding},
  author = {Sen Jia and Lei Li},
  journal= {arXiv preprint arXiv:2410.03161},
  year   = {2024}
}

备注

Code will be available at https://github.com/git-lenny/IMAGE