中文

基于合成标签生成与知识蒸馏的无标签异构文档信息抽取

计算与语言 2024-11-26 v2

摘要

发票和收据是组织提交的视觉丰富文档 (VRD),包含文本、视觉及布局信息。为防止欺诈与滥用,组织必须高效抽取所需信息,以评估费用申报的合适性、支出与交易政策的遵从情况、收据的有效性,以及various 层面的异常检测。这些文档异构多样,格式、语言各异,图像质量不同,常不含 ground truth 标签。本文提出 Task Aware Instruction-based Labelling (TAIL) 方法,用于无标签 VRD 语料的合成标签生成,并在 TAIL 标签上微调多模态视觉丰富文档理解模型 (VRDU),采用 response-based 知识蒸馏,无需使用教师模型权重或训练数据,条件性生成适当格式的注释。在外部 benchmark 数据集上验证,我们的方法在某些条件下可与 Claude 3 Sonnet 持平。随后展示,所得模型在大型跨国组织的内部费用文档上表现优于 state-of-the-art LMM Claude 3 Sonnet,成本降低 85%,速度提升约 5 倍,因其稀有格式下的推理与抽取能力,在 Average Normalized Levenshtein Similarity (ANLS) 分数上超越布局感知基线 10%以上。最后说明该方法在防止超支中的应用。

关键词

引用

@article{arxiv.2411.14957,
  title  = {Information Extraction from Heterogeneous Documents without Ground Truth Labels using Synthetic Label Generation and Knowledge Distillation},
  author = {Aniket Bhattacharyya and Anurag Tripathi},
  journal= {arXiv preprint arXiv:2411.14957},
  year   = {2024}
}

备注

Accepted to WACV 2025