PROMPT-IML:通过提示微调利用预训练基础模型进行图像篡改定位
计算机视觉与模式识别
2024-01-02 v1
摘要
欺骗性图像可以在几秒钟内通过社交网络服务分享,带来巨大风险。在图像篡改定位(IML)领域,边界伪影和高频信息等篡改痕迹受到了大规模网络的极大重视。然而,它们容易受到图像后处理操作的影响,这限制了现有方法的泛化能力和鲁棒性。我们提出了一种新颖的 Prompt-IML 框架。我们观察到,人类倾向于根据语义和高频信息来辨别图像的真实性,受此启发,该框架利用预训练视觉基础模型中丰富的语义知识来辅助 IML。我们是首个专门针对 IML 任务设计利用视觉基础模型的框架。此外,我们设计了特征对齐与融合模块,以对齐并融合语义特征与高频特征,旨在从多个视角定位篡改区域。实验结果表明,我们的模型在八个典型的伪造图像数据集上能够取得更好的性能,并具有出色的鲁棒性。
引用
@article{arxiv.2401.00653,
title = {PROMPT-IML: Image Manipulation Localization with Pre-trained Foundation Models Through Prompt Tuning},
author = {Xuntao Liu and Yuzhou Yang and Qichao Ying and Zhenxing Qian and Xinpeng Zhang and Sheng Li},
journal= {arXiv preprint arXiv:2401.00653},
year = {2024}
}
备注
Under Review