当眼睛告诉AI:社交凝视一致性作为AI生成图像检测的语义线索
计算机视觉与模式识别
2026-05-28 v2 人工智能
摘要
最近的生成模型在低层次瑕疵——像素指纹、频率异常、上采样痕迹——方面已大幅缩小尤其是在以人为中心和局部编辑场景中,其中操作区域较小且被光照正常的内容包围。在此基础上,我们提出了社交凝视一致性,这是一种高层次语义线索,定义为交互个体之间凝视方向、头部-眼部对齐和瞳孔位置之间的相互一致性,表明它构成了一个此前未被充分利用的检测轴,与现有低层次范式正交。我们通过三种耦合机制实现了这一洞察:(i)一个受控诊断数据集,对凝视一致的图像进行区域特定扰动,严格的双层级分组排除了生成器指纹记忆作为优化时间的捷径,而不是依赖数据增强;(ii)块状构成的标题超级监督,保持单个5模块推理框架不变于1,250个宏组合标题之间,解耦推理一致性与表面多样性;(iii)跨架构验证表明,相同监督方式使视觉-语言背bone(FakeVLM)在COCOAI Interaction子集上提升3.7个百分点(平衡准确率67.8->71.5),在COCOAI Person子集上提升1.3个百分点(83.0->84.3),且在视觉单一背bone(Effort)上也表现出一致 gains,证明了该线索具有架构中性。实与虚类的召回率同时上升,排除了“全预测为伪造”的伪 artifact。我们提出了一个四步机械模型——配对编辑捷径阻断、难易难度转移、CLIP先验保持、扩散家族在瞳睑结构上的共同弱点——解释了在单个填充器(FLUX.1-Fill)训练后为何能迁移到多生成器套件。我们将在接受录取后发布代码以促进可重复性。
引用
@article{arxiv.2605.27348,
title = {When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection},
author = {Jihyeon Kim and Sohee Kim and Soosan Lee and Souhwan Jung and James Matthew Rehg and Hyesong Choi},
journal= {arXiv preprint arXiv:2605.27348},
year = {2026}
}
备注
23 pages, 2 figures, 17 tables