VDInstruct:基于内容感知视觉分词的零样态关键信息提取
计算机视觉与模式识别
2025-07-15 v1 人工智能
机器学习
摘要
关键信息提取(KIE)是理解视觉文档(如收据和合同)的基础,通过精确提取语义内容并准确捕获空间结构来实现。然而,现有的多模态大语言模型(MLLM)在密集文档上往往表现不佳,且依赖随图像大小尺度化的视觉分词方法,导致冗余计算和内存效率低下。为此,我们引入 VDInstruct,一种将空间区域检测与语义特征提取分离的 MLLM。我们模型的核心是内容感知分词策略:而非对整个图像均匀碎片化,它按文档复杂度比例生成标记,保留关键结构同时消除浪费的标记。基于三阶段训练范式,我们的模型在 KIE 基准测试中实现了最先进(SOTA)结果,准确率与领先方法持平或更好,同时将图像标记数量约降低 3.6 倍。在零样态评估中,VDInstruct 超越了 DocOwl 1.5 等强大基准 +5.5 F1 分数,凸显其对未见文档的鲁棒性。这些发现表明,内容感知分词结合显式布局建模为文档理解领域的前进方向提供了可行方案。数据、源代码和模型权重将公开释放。
引用
@article{arxiv.2507.09531,
title = {VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization},
author = {Son Nguyen and Giang Nguyen and Hung Dao and Thao Do and Daeyoung Kim},
journal= {arXiv preprint arXiv:2507.09531},
year = {2025}
}
备注
Under Review