中文

AI生成图像的语义视觉异常检测与推理

计算机视觉与模式识别 2025-10-14 v1

摘要

AI生成内容 (AIGC) 的快速发展使得能够合成逼真的视觉图像;然而,这些输出常表现出细微的语义异常,包括不现实的对象配置、违反物理法则或常识不一致之处,这会损害生成场景的整体可信度。检测这些语义层面的异常对于评估AIGC媒体的可信度尤其重要,特别是在AIGC图像分析、可解释深度伪造检测和语义真实性评估方面。本文对AIGC图像的语义异常检测与推理进行形式化建模,引入AnomReason基准,包含结构化注释的四元组 (Name, Phenomenon, Reasoning, Severity)。注释由模块化的多智能体管线 (AnomAgent) 生成,采用轻量级的人类在环验证,既能实现规模,又能保持质量。在构建阶段,AnomAgent处理了约4.17万亿个GPT-4o token,为结构化注释提供了规模证据。我们进一步表明,在本文提出的语义匹配指标 (SemAP 和 SemF1) 下,针对AnomReason微调的模型在强大的视觉-语言基线上实现一致的提升。应用于可解释深度伪造检测和图像生成器的语义合理性评估,显示出实际应用价值。总之,AnomReason和AnomAgent为衡量和改进AI生成图像的语义可信度提供了基础。我们将发布代码、指标、数据和任务对齐的模型,以支持语义真实性和可解释AIGC法医学的可重复研究。

关键词

引用

@article{arxiv.2510.10231,
  title  = {Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images},
  author = {Chuangchuang Tan and Xiang Ming and Jinglu Wang and Renshuai Tao and Bin Li and Yunchao Wei and Yao Zhao and Yan Lu},
  journal= {arXiv preprint arXiv:2510.10231},
  year   = {2025}
}

备注

27 pages, 7 figures