AlignGemini:基于任务-模型对齐的通用AI生成图像检测
计算机视觉与模式识别
2026-02-02 v2 人工智能
摘要
视觉语言模型(VLM)日益用于检测AI生成图像(AIGI)。然而,将 VLM 转换为可靠检测器耗费资源,而且生成的模型常出现幻觉且泛化性差。为调查根本原因,我们进行经验分析,发现两种一致行为:第一,采用语义监督微调的 VLM 在语义判别上表现良好,能泛化到未见数据;第二,采用像素-工艺监督微调的 VLM 泛化较弱。这些发现揭示了根本的任务-模型错位。VLM 优化的是高层语义推理,缺乏对低层像素工艺的归纳偏置;相比之下,传统视觉模型有效捕获像素级工艺,但对语义不一致不够敏感。这表明不同模型天然适合不同的子任务。基于这一洞察,我们将 AIGI 检测形式化为两个正交子任务:语义一致性检查和像素-工艺检测。忽略任一子任务都会导致系统检测失败。我们进一步提出任务-模型对齐原则,并在其基础上构建了两个分支检测器 AlignGemini。该检测器组合了采用纯语义监督训练的 VLM 和采用纯像素-工艺监督训练的视觉模型。通过明确的专业化,每一分支捕获互补的线索。实验在野外基准测试上显示,AlignGemini 使用简化训练数据后平均准确率提升 9.5 个百分点。这些结果表明,任务-模型对齐是通用 AIGI 检测的有效原则。
引用
@article{arxiv.2512.06746,
title = {AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment},
author = {Ruoxin Chen and Jiahui Gao and Kaiqing Lin and Keyue Zhang and Yandan Zhao and Isabel Guan and Taiping Yao and Shouhong Ding},
journal= {arXiv preprint arXiv:2512.06746},
year = {2026}
}