利用丰富监督增强视觉 - 语言预训练
计算机视觉与模式识别
2025-03-14 v2
摘要
我们提出了带有屏幕截图的强监督预训练 (S4) —— 一种利用大规模网页截图渲染数据进行视觉 - 语言模型预训练的新范式。使用网页截图解锁了大量在使用图像 - 文本对时不存在的视觉和文本线索。在 S4 中,我们利用 HTML 元素固有的树状层次结构和空间定位,精心设计了对应大规模标注数据的 10 个预训练任务。这些任务类似于不同领域的下游任务,且其标注成本低廉。我们证明,与当前的截图预训练目标相比,我们创新的预训练方法显著提升了图像到文本模型在九个多样化且流行的下游任务中的性能——在表格检测任务上提升高达 76.1%,在组件描述任务上至少提升 1%。
引用
@article{arxiv.2403.03346,
title = {Enhancing Vision-Language Pre-training with Rich Supervisions},
author = {Yuan Gao and Kunyu Shi and Pengkai Zhu and Edouard Belval and Oren Nuriel and Srikar Appalaraju and Shabnam Ghadar and Vijay Mahadevan and Zhuowen Tu and Stefano Soatto},
journal= {arXiv preprint arXiv:2403.03346},
year = {2025}
}
备注
Accepted to CVPR 2024