中文

面向零样本文档图像问答的布局与任务感知指令提示

计算与语言 2023-09-08 v4 人工智能 计算机视觉与模式识别

摘要

布局感知预训练模型在文档图像问答上已取得显著进展。它们在现有语言模型中引入额外的可学习模块,以从 OCR 工具获得的文本边界框坐标中捕获文档图像内的布局信息。然而,额外的模块需要在大量文档图像上预训练。这阻碍了这些方法直接利用现成的指令微调语言基础模型,后者近期在零样本学习中展现出 promising 潜力。相反,本文中我们发现如 Claude 和 ChatGPT 之类的指令微调语言模型能通过空格和换行理解布局。基于该观察,我们提出布局与任务感知指令提示(LAyout and Task aware Instruction Prompt, LATIN-Prompt),其由布局感知文档内容与任务感知指令组成。具体而言,前者使用适当的空格和换行来恢复 OCR 工具所得文本段间的布局信息,后者确保生成答案符合格式要求。此外,我们提出布局与任务感知指令微调(LAyout and Task aware Instruction Tuning, LATIN-Tuning)以提升如 Alpaca 等小型指令微调模型的性能。实验结果表明,LATIN-Prompt 使 Claude 和 ChatGPT 的零样本性能可与文档图像问答上 SOTA 的微调性能相媲美,且 LATIN-Tuning 显著增强了 Alpaca 的零样本性能。例如,LATIN-Prompt 在 DocVQA 上分别将 Claude 和 ChatGPT 的性能提升 263% 和 20%。LATIN-Tuning 在 DocVQA 上将 Alpaca 的性能提升 87.7%。定量与定性分析证明了 LATIN-Prompt 与 LATIN-Tuning 的有效性。我们在补充材料中提供代码并将发布以促成未来研究。

关键词

引用

@article{arxiv.2306.00526,
  title  = {Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering},
  author = {Wenjin Wang and Yunhao Li and Yixin Ou and Yin Zhang},
  journal= {arXiv preprint arXiv:2306.00526},
  year   = {2023}
}

备注

Add the LATIN-Tuning for Alapca. Code is available at https://github.com/WenjinW/LATIN-Prompt