中文

Pix2Struct:以截图解析作为视觉语言理解的预训练

计算与语言 2023-06-19 v2 计算机视觉与模式识别

摘要

视觉情境语言无处不在——来源从带图的教科书到含图像与表格的网页,再到带按钮和表单的移动应用。或许由于这种多样性,以往工作通常依赖特定领域的方案,对底层数据、模型架构和目标的共享有限。我们提出 Pix2Struct,一个用于纯视觉语言理解的预训练图像到文本模型,可微调于包含视觉情境语言的任务。Pix2Struct 通过学会将网页的掩码截图解析为简化 HTML 来进行预训练。网络以其丰富的视觉元素在 HTML 结构中干净地反映,提供了非常适合下游任务多样性的大规模预训练数据源。直观上,该目标涵盖了常见的预训练信号如 OCR、语言建模、图像描述。除新颖的预训练策略外,我们引入了变分辨率输入表示以及更灵活的语言与视觉输入整合,其中语言提示(如问题)直接渲染在输入图像之上。我们首次展示单一预训练模型可在四个领域(文档、插图、用户界面和自然图像)九项任务中的六项上取得最先进结果。

关键词

引用

@article{arxiv.2210.03347,
  title  = {Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding},
  author = {Kenton Lee and Mandar Joshi and Iulia Turc and Hexiang Hu and Fangyu Liu and Julian Eisenschlos and Urvashi Khandelwal and Peter Shaw and Ming-Wei Chang and Kristina Toutanova},
  journal= {arXiv preprint arXiv:2210.03347},
  year   = {2023}
}

备注

Accepted at ICML