面向身份证件的 LLM 条码: 生成多样化合成数据
计算与语言
2024-12-25 v2 人工智能
密码学与安全
摘要
身份证件中的条码检测与解码对于安全、医疗及教育等应用至关重要,因 reliable 数据抽取与验证至关重要。构建鲁棒检测模型的挑战在于缺乏多样化真实数据集,这往往与隐私问题及 document format 多样性有关。传统工具如 Faker 依赖预定义模板,难以捕捉真实身份证件的复杂性。本文提出一种新方法,通过 LLM 生成上下文丰富且真实的数据,无需依赖预定义字段。利用 LLM 对不同 document 与 content 的广泛认识,该方法创建反映真实身份证件多样性的数据,并编码为条码,叠加于驾照、保险卡、学生证等 document 模板上。该方法简化数据集创建流程,无需 extensive domain knowledge 或预定义字段。与传统方法如 Faker 相比,LLM 生成的数据在多样性与上下文相关性方面更优,提升条码检测模型性能。该可扩展、隐私优先的解决方案是推动机器学习在自动化 document 处理与身份验证方面应用的重要进展。
引用
@article{arxiv.2411.14962,
title = {LLM for Barcodes: Generating Diverse Synthetic Data for Identity Documents},
author = {Hitesh Laxmichand Patel and Amit Agarwal and Bhargava Kumar and Karan Gupta and Priyaranjan Pattnayak},
journal= {arXiv preprint arXiv:2411.14962},
year = {2024}
}
备注
5 pages, 1 figures