提升基于截图的语言理解能力
计算与语言
2024-02-27 v1 计算机视觉与模式识别
机器学习
摘要
新兴的一类语言模型(LMs)能够在单个视觉视图中同时处理文本和图像,有望解锁图表理解和用户界面导航等复杂任务。我们将这些模型称为截图语言模型。尽管具有吸引力,现有的截图语言模型在语言理解任务上大幅落后于纯文本模型。为了缩小这一差距,我们采用了一种简化的设置,其中模型输入为纯文本渲染的截图,并专注于提高截图语言模型的文本能力。我们提出了一种新颖的补丁与文本预测(Patch-and-Text Prediction, PTP)目标,该目标同时对截图的图像补丁和截图内的文本进行掩码和恢复。我们还对掩码率、补丁大小以及提高训练稳定性的设计进行了广泛的消融研究。我们的预训练模型虽然仅接受视觉输入,但在 8 个 GLUE 任务中的 6 个上取得了与 BERT 相当的性能(差距在 2% 以内),并且相比 prior work 提升了高达 8%。此外,我们将 PTP 扩展用于训练自回归截图语言模型并证明了其有效性——我们的模型可以通过利用截图上下文显著降低困惑度。总之,我们希望我们的发现能激发未来关于开发强大截图语言模型并将其扩展到更广泛应用的研究。
引用
@article{arxiv.2402.14073,
title = {Improving Language Understanding from Screenshots},
author = {Tianyu Gao and Zirui Wang and Adithya Bhaskar and Danqi Chen},
journal= {arXiv preprint arXiv:2402.14073},
year = {2024}
}
备注
Our model and code are available at https://github.com/princeton-nlp/PTP