TwoHead-SwinFPN:用于身份证件合成篡改、检测与定位的统一深度学习架构
计算机视觉与模式识别
2026-01-21 v1 机器学习
摘要
复杂生成式 AI 模型的激增显著加剧了身份证件中合成篡改的威胁,特别是通过换脸和文本修复攻击。本文提出了 TwoHead-SwinFPN,这是一种统一的深度学习架构,可同时执行二分类和精确定位身份证件中的篡改区域。我们的方法将 Swin Transformer 主干网络与特征金字塔网络 (FPN) 和 UNet 风格的解码器集成,并采用卷积块注意力模块 (CBAM) 进行增强,以改善特征表示。该模型采用双头架构,用于检测和分割任务的联合优化,利用不确定性加权多任务学习。在 FantasyIDiap 数据集上的大量实验证明了其卓越的性能,分类准确率达到 84.31%,AUC 达到 90.78%,定位的平均 Dice 分数达到 57.24%。该方法在二分类中达到了 88.61% 的 F1 分数,同时通过 FastAPI 实现保持了适合现实世界部署的计算效率。我们的综合评估包括消融研究、跨设备泛化分析,以及跨 10 种语言和 3 种采集设备的详细性能评估。
引用
@article{arxiv.2601.12895,
title = {TwoHead-SwinFPN: A Unified DL Architecture for Synthetic Manipulation, Detection and Localization in Identity Documents},
author = {Chan Naseeb and Adeel Ashraf Cheema and Hassan Sami and Tayyab Afzal and Muhammad Omair and Usman Habib},
journal= {arXiv preprint arXiv:2601.12895},
year = {2026}
}
备注
8 pages