基于语义视觉损失的高效端到端视觉语言预训练
计算机视觉与模式识别
2023-01-19 v1
摘要
当前的视觉语言预训练模型主要由使用从目标检测器提取的区域视觉特征的方法主导。鉴于其良好性能,这种先提取再处理的流程严重限制了推理速度,从而限制了其实际应用场景。然而,从原始图像像素训练视觉语言模型是困难的,因为原始图像像素给出的先验知识远少于区域特征。本文中,我们系统研究了如何利用辅助视觉预训练任务来帮助训练端到端视觉语言模型。我们引入了三类视觉损失,能够实现更快的收敛和更好的微调精度。与区域特征模型相比,我们的端到端模型能在下游任务上取得相似或更好的性能,并在推理时快10倍以上。与其他端到端模型相比,我们的方法在仅以10%的预训练GPU时长进行预训练时即可取得相似或更好的性能。
引用
@article{arxiv.2301.07236,
title = {Effective End-to-End Vision Language Pretraining with Semantic Visual Loss},
author = {Xiaofeng Yang and Fayao Liu and Guosheng Lin},
journal= {arXiv preprint arXiv:2301.07236},
year = {2023}
}