中文

NovaLAD:面向生成式 AI 与数据智能的高速、CPU 优化文档提取管道

计算机视觉与模式识别 2026-03-03 v1 人工智能 信息检索

摘要

文档提取是检索增强生成(RAG)、知识库以及下游生成式 AI 工作流程中的关键步骤。它将非结构化文档(如 PDF 和扫描件)转化为结构化文本和布局感知的表示。我们介绍 NovaLAD,一个综合性的文档解析系统,集成了两个并行运行的 YOLO 目标检测模型——元素检测与布局检测——以及基于规则的分组和可选的视觉语言增强。当页面图像输入后,首先同时通过两个模型进行处理。元素模型检测语义内容(如标题、页眉、文本、表格、图像等),布局模型检测结构区域(如 layout_box、column_group、multi_column、row_group 等)。关键设计决策是:首先通过图像分类器(ViT)判断图像或插图是否相关。仅将有用的图像提交给视觉语言模型进行标题、摘要和结构化信息提取,从而降低噪声和成本。NovaLAD 注重性能:其在 CPU 上运行,采用并行执行进行检测、分类、OCR 和转换,并生成多种形式,包括结构化 JSON、Markdown、RAG 就绪文本和知识图谱。我们在 DP-Bench 基准(upstage/dp-bench)上进行测试,获得 96.49% 的 TEDS 和 98.51% 的 NID,优于商业和开源解析器。本文阐述了数据提取方法、架构设计、数据流向以及如何在无需 GPU 的情况下实现 NovaLAD 的高精度与高可用性。

关键词

引用

@article{arxiv.2603.00122,
  title  = {NovaLAD: A Fast, CPU-Optimized Document Extraction Pipeline for Generative AI and Data Intelligence},
  author = {Aman Ulla},
  journal= {arXiv preprint arXiv:2603.00122},
  year   = {2026}
}

备注

17 pages, 10 figures, 5 tables