中文

ForgeryTTT:基于测试时训练的零样图象操纵局部化

计算机视觉与模式识别 2024-10-08 v1

摘要

社交媒体日益受到逼真假图像的困扰,使得内容难以信任。以往用于检测这些伪造图像的算法常在新出现的真实场景中失效,因为它们训练于特定数据集。为此,我们提出 ForgeryTTT,首个利用测试时训练(TTT)识别操纵区域的方法。该方法为每个独立测试样本进行微调,以提升性能。ForgeryTTT 首先采用视觉 Transformer 作为共享图像编码器,在训练时使用大型合成数据集同时学习分类和局部化任务。具体而言,局部化头预测掩码以突出显示操纵区域。据此,输入 token 可划分为操纵组和真实组,分别输入到分类头以区分操纵与真实部分。在测试时训练中,使用局部化头预测的掩码更新图像编码器以实现更好适应。此外,采用经典 dropout 策略于每个 token 组可显著提升性能与效率。我们在五个标准基准上测试 ForgeryTTT。尽管方法简单, ForgeryTTT 在其他零样方法中的局部化准确率提升 20.1%,相较于非零样方法提升 4.3%。本文将在发表后公开代码与数据。

关键词

引用

@article{arxiv.2410.04032,
  title  = {ForgeryTTT: Zero-Shot Image Manipulation Localization with Test-Time Training},
  author = {Weihuang Liu and Xi Shen and Chi-Man Pun and Xiaodong Cun},
  journal= {arXiv preprint arXiv:2410.04032},
  year   = {2024}
}

备注

Technical Report