中文

用于开集身份证欺诈发现的布局感知表征学习

计算机视觉与模式识别 2026-05-08 v1 人工智能 机器学习

摘要

身份证欺诈检测并非固定的二元分类问题。适应性攻击者会修改模板和制造流程,使历史欺诈标签变得陈旧,成功的伪造品反复出现并形成规模化的联合作战。因此,我们研究了围绕布局感知表征学习进行开集欺诈发现,而不仅仅是封闭集分类。我们通过基于感知注意力的 SimMIM 微调和带有复合损失的监督度量学习来适配 DINOv3 以文档领域为导向,该复合损失鼓励类间可分性和类内紧凑性。模型仅使用美国身份证进行训练。配合轻量级 MLP 和 softmax 分类器,该嵌入在加拿大布局上实现了 99.83% 的布局分类准确率。此外,在一组 20,448 份加拿大身份证数据集上,嵌入空间分析发现了 276 例自适应物理欺诈案例,其中包括 222 例未被现有检测器发现的案例。该嵌入支持从单个已确认的种子进行基于相似度的扩展,以发现由常规元数据图无法链接的其他相关案例。布局感知的文档嵌入为在分布迁移下发现新型和规模化欺诈提供了生产环境可对齐的基础。

关键词

引用

@article{arxiv.2605.05215,
  title  = {Layout-Aware Representation Learning for Open-Set ID Fraud Discovery},
  author = {Jinxing Li and Nicholas Ren and Cathy Chang and Hongkai Pan and Daniel George},
  journal= {arXiv preprint arXiv:2605.05215},
  year   = {2026}
}