面向语言、视觉及视觉-语言理解任务构建通用基础模型
计算机视觉与模式识别
2023-10-18 v2 人工智能
摘要
基础模型或预训练模型已显著提升了各种语言、视觉和视觉-语言理解任务的性能。然而,现有的基础模型只能在某一类任务(即语言、视觉或视觉-语言)中表现最佳。是否有可能构建一个在所有理解任务中都表现最佳的通用基础模型,仍是一个悬而未决的问题。在本文中,我们提出了一种新的通用基础模型 X-FM(X-Foundation Model)。X-FM 拥有一个语言编码器、一个视觉编码器和一个融合编码器,以及一种新的训练方法。该训练方法包含两项从文本、图像和图文对数据中学习 X-FM 的新技术。一是在学习语言编码器时停止来自视觉-语言训练的梯度。二是利用视觉-语言训练来引导视觉编码器的学习。在基准数据集上的大量实验表明,X-FM 能显著优于现有的通用基础模型,并且其性能优于或可比肩专门用于语言、视觉或视觉-语言理解的现有基础模型。代码和预训练模型已在 https://github.com/zhangxinsong-nlp/XFM 发布。
引用
@article{arxiv.2301.05065,
title = {Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks},
author = {Xinsong Zhang and Yan Zeng and Jipeng Zhang and Hang Li},
journal= {arXiv preprint arXiv:2301.05065},
year = {2023}
}