基于区域引导注意力的层级掩码调制 AI 脸部检测
计算机视觉与模式识别
2026-02-27 v2
摘要
检测 AI 人工合成脸部图像是一项关键挑战:难以捕捉不同生成技术之间面部区域之间的一致结构关系。当前方法侧重于特定人工痕迹而非根本性不一致,往往在面对新型生成模型时会失效。为此,我们提出了一种面向鲁棒脸部伪造检测的 Layer-aware Mask Modulation Vision Transformer(LAMM-ViT),这是一种面向视觉转换器的模型。该模型将不同的 Region-Guided Multi-Head Attention(RG-MHA)和 Layer-aware Mask Modulation(LAMM)组件集成到每个层中。RG-MHA 利用面部关键点创建区域注意力掩码,引导模型审查不同面部区域之间的架构性不一致。关键的是,独立的 LAMM 模块基于网络上下文动态生成层特定参数,包括掩码权重和门控值。这些参数随后调制 RG-MHA 的行为,使其能够在网络深度范围内自适应地调整区域关注度。这一架构促进了捕捉不同生成技术(如 GAN 和扩散模型)普遍存在的细微、层次化伪造线索。在跨模型泛化测试中,LAMM-ViT 实现了 94.09% 的平均准确率(提升 5.45%)和 98.62% 的平均平均精确率(提升 3.09%),这些结果表明 LAMM-ViT 在捕捉细微伪造线索方面具有卓越能力,具备可靠应对不断演化的合成媒体威胁的潜力。
引用
@article{arxiv.2505.07734,
title = {LAMM-ViT: AI Face Detection via Layer-Aware Modulation of Region-Guided Attention},
author = {Jiangling Zhang and Weijie Zhu and Jirui Huang and Yaxiong Chen},
journal= {arXiv preprint arXiv:2505.07734},
year = {2026}
}
备注
Accepted to ECAI 2025