中文

ArtifactLens:仅需数百个标签即可通过视觉语言模型检测人工生成图像中的伪影

计算机视觉与模式识别 2026-02-11 v1 人工智能 机器学习

摘要

现代图像生成器会产生令人惊叹的逼真图像,其中只有类似变形手部或扭曲物体等伪影会揭示其合成来源。检测这些伪影至关重要:若不检测,就无法对生成器进行基准测试,也无法训练奖励模型来改进生成器。当前的检测器需要在数万张标记图像上微调视觉语言模型,但每次生成器更新或新伪影类型出现时都需大量重复工作。我们展示,预训练的视觉语言模型已经编码了检测伪影所需的知识——只需通过恰当的 scaffolding 掩码,这一能力只需每个伪影类别使用少量标记样本即可解锁。我们的系统 ArtifactLens 在五个人类伪影基准测试中实现了最新成果(首次在多个数据集上进行评估),且所需标记数据量降低了数量级。scaffolding 包括一个多组件架构,集成了 in-context learning 和文本指令优化,并对每个组件进行了新颖改进。我们的方法可推广至其他伪影类型——包括物体形态、动物解剖结构以及实体相互作用——以及明确的 AIGC 检测任务。

关键词

引用

@article{arxiv.2602.09475,
  title  = {ArtifactLens: Hundreds of Labels Are Enough for Artifact Detection with VLMs},
  author = {James Burgess and Rameen Abdal and Dan Stoddart and Sergey Tulyakov and Serena Yeung-Levy and Kuan-Chieh Jackson Wang},
  journal= {arXiv preprint arXiv:2602.09475},
  year   = {2026}
}

备注

https://jmhb0.github.io/ArtifactLens/