像素与文本的自回归预训练
计算与语言
2024-10-04 v3 计算机视觉与模式识别
摘要
将视觉与文本信息集成代表了语言模型发展的有前景方向。本文探索了语言中双重模态——视觉与文本——在自回归框架中的集成,基于文档图像和文本进行预训练。我们的方法采用多模态训练策略,通过具有回归头的下一个图块预测来处理视觉数据,或通过具有分类头的下一个标记预测来处理文本数据。我们专注于理解这两种模态之间的相互作用及其对模型性能的综合影响。我们的广泛评估显示,纳入视觉与文本数据显著提高了基于像素的语言模型性能。令人惊讶的是,我们发现仅基于视觉数据训练的单向像素模型,在几个语言理解任务上的表现可与最先进的双向模型相当。本工作揭示了将视觉与文本模态集成以实现更有效语言建模的潜在潜力。我们在\url{https://github.com/ernie-research/pixelgpt}发布了代码、数据和模型检查点。
引用
@article{arxiv.2404.10710,
title = {Autoregressive Pre-Training on Pixels and Texts},
author = {Yekun Chai and Qingyi Liu and Jingwu Xiao and Shuohuan Wang and Yu Sun and Hua Wu},
journal= {arXiv preprint arXiv:2404.10710},
year = {2024}
}
备注
EMNLP 2024