中文

AEGIS:一个用于评估AI生成学术图像取证分析的整体基准

计算机视觉与模式识别 2026-05-22 v2 计算机与社会

摘要

我们引入了AEGIS,一个用于评估AI生成学术图像取证分析的整体基准。与现有基准相比,AEGIS具有三个关键进展:(1)领域特定复杂性:涵盖七个学术类别及39个细粒度子类型,揭示了内在的取证难度,即使GPT-5.1的整体性能也仅为48.80%,专家模型仅达到有限的定位精度(IoU 30.09%);(2)多样化伪造模拟:在25个生成模型中模拟了四种普遍的学术伪造策略,其中11个模型的平均取证准确率低于50%,表明取证技术滞后于生成技术的进步;(3)多维度取证评估:联合评估检测、推理和定位能力,揭示了模型家族之间的互补优势,多模态大语言模型(MLLMs)在文本伪影识别上的准确率为84.74%,而专家检测器在二值真伪检测上的准确率最高达到79.54%。通过评估25个领先的MLLMs、九个专家模型和一个统一的多模态理解与生成模型,AEGIS作为一个诊断测试平台,揭示了学术图像取证中的根本性局限。

关键词

引用

@article{arxiv.2604.28177,
  title  = {AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images},
  author = {Bo Zhang and Tzu-Yen Ma and Zichen Tang and Junpeng Ding and Zirui Wang and Yizhuo Zhao and Peilin Gao and Zijie Xi and Zixin Ding and Haiyang Sun and Haocheng Gao and Yuan Liu and Liangjia Wang and Yiling Huang and Yujie Wang and Yuyue Zhang and Ronghui Xi and Yuanze Li and Jiacheng Liu and Zhongjun Yang and Haihong E},
  journal= {arXiv preprint arXiv:2604.28177},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main Conference