中文

稀疏 ViT:通过稀疏编码 Transformer 实现无语义中心化的图像操纵定位

计算机视觉与模式识别 2024-12-24 v2

摘要

非语义特征或语义中性特征是与图像上下文无关但对图像操纵敏感的特征,被认作是图像操纵定位 (IML) 的证据。由于不可能获得手动标签,现有工作依赖于手工方法提取非语义特征。手工非语义特征危及 IML 模型在未见或复杂场景中的泛化能力。因此,IML 的核心挑战是:如何自适应提取非语义特征?非语义特征是上下文无关且操纵敏感的,即在图像中,它们在除操纵发生外的各 patch 间保持一致。因此,稀疏且离散的 patch 间交互对于提取非语义特征足够。然而,图像语义在不同 patch 间差异巨大,需要稠密且连续的 patch 间交互来学习语义表示。因此,本文提出了稀疏视觉 Transformer (SparseViT),将 ViT 中的稠密全局自注意力重新构建为稀疏离散的方式。这种稀疏自注意力机制打破了图像语义,并迫使 SparseViT 为图像自适应提取非语义特征。此外,与现有 IML 模型相比,稀疏自注意力机制大幅减少模型规模(FLOPs 最多降低 80%),实现了惊人的参数效率和计算降低。大量实验表明,在无需任何手工特征提取器的情况下,SparseViT 在各基准数据集上在泛化性和效率方面均表现出色。

关键词

引用

@article{arxiv.2412.14598,
  title  = {Can We Get Rid of Handcrafted Feature Extractors? SparseViT: Nonsemantics-Centered, Parameter-Efficient Image Manipulation Localization through Spare-Coding Transformer},
  author = {Lei Su and Xiaochen Ma and Xuekang Zhu and Chaoqun Niu and Zeyu Lei and Ji-Zhe Zhou},
  journal= {arXiv preprint arXiv:2412.14598},
  year   = {2024}
}

备注

published to AAAI2025