中文

实现最高 36 倍加速:面向 MLLM 键信息抽取的掩码并行推理范式

计算与语言 2026-01-28 v1 人工智能

摘要

从视觉丰富文档(VrDs)中提取关键信息(KIE)是一个关键任务,近期的大型语言模型(LLM)和多模态大型语言模型(MLLM)已显示出强大的潜力。然而,他们依赖自回归推理,即顺序生成输出,造成了显著的效率瓶颈,尤其是因为 KIE 任务通常涉及提取多个在语义上独立的字段。为克服这一限制,我们引入了 PIP:一种面向 KIE 的并行推理范式。我们的方法通过使用“[mask]”标记作为所有目标值的占位符,使其在单次前向传递中同时生成,从而实现并行化。为促进这一范式,我们开发了针对性的掩码预训练策略并构建了大规模监督数据集。实验结果表明,我们的 PIP 模型在推理速度上实现了 5-36 倍的加速,与传统自回归基准模型相比几乎不影响性能。通过在保持高准确率的同时大幅提高效率,PIP 为可扩展且实用的实际 KIE 解决方案铺平了道路。

关键词

引用

@article{arxiv.2601.19613,
  title  = {Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs},
  author = {Xinzhong Wang and Ya Guo and Jing Li and Huan Chen and Yi Tu and Yijie Hong and Gongshen Liu and Huijia Zhu},
  journal= {arXiv preprint arXiv:2601.19613},
  year   = {2026}
}

备注

Accepted by ICASSP 2026