AnyPattern:面向语境图像复制检测的通用方法
计算机视觉与模式识别
2024-10-01 v3 人工智能
摘要
本文探索了用于图像复制检测(ICD)的语境学习,即在无需额外训练的情况下,对 ICD 模型进行提示以识别新的篡改模式。这些提示(或上下文)来自一小组反映新模式的图像复制对,供推理时使用。这种语境下的 ICD 具有良好的现实价值,因为它无需微调,从而便于快速应对未见模式的出现。为适应“已见→未见”泛化场景,我们构建了第一个大型模式数据集 named AnyPattern,拥有最大数量的篡改模式(训练时为90个,测试时为10个),以超越现有数据集。我们对 AnyPattern 与流行的 ICD 方法进行基准测试,发现现有方法几乎无法泛化到新模式。我们进一步提出一种简单的语境 ICD 方法,名为 ImageStacker。ImageStacker 学习选择最具代表性的图像复制对,并以堆叠方式(而非流行的拼接方式)将其作为模式提示。实验结果表明:(1)使用我们大型数据集在显著提升模式泛化性(提升 ),(2)所提出的 ImageStacker 促进有效的语境 ICD(额外提升 ),(3)AnyPattern 使语境学习成为可能,即在没有此大型数据集的情况下,即使有我们的 ImageStacker,语境学习也无法出现。除了 ICD 任务之外,我们还展示了 AnyPattern 如何惠及艺术家,即在 AnyPattern 上训练的模式检索方法可泛化用于识别文本到图像模型的风格模仿。该项目已公开于 https://anypattern.github.io。
引用
@article{arxiv.2404.13788,
title = {AnyPattern: Towards In-context Image Copy Detection},
author = {Wenhao Wang and Yifan Sun and Zhentao Tan and Yi Yang},
journal= {arXiv preprint arXiv:2404.13788},
year = {2024}
}
备注
The project is publicly available at https://anypattern.github.io