图像即外语:面向所有视觉与视觉-语言任务的 BEiT 预训练
计算机视觉与模式识别
2022-09-01 v2 计算与语言
摘要
语言、视觉与多模态预训练的大融合正在浮现。本工作中,我们引入通用多模态基础模型 BEiT-3,其在视觉与视觉-语言任务上均取得最先进的迁移性能。具体而言,我们从三方面推进这一大融合:骨干架构、预训练任务与模型扩展。我们引入 Multiway Transformers 用于通用建模,其模块化架构同时支持深度融合与模态特定编码。基于共享骨干,我们以统一方式对图像(Imglish)、文本(English)和图像-文本对(“平行句”)执行掩码“语言”建模。实验结果表明,BEiT-3 在目标检测(COCO)、语义分割(ADE20K)、图像分类(ImageNet)、视觉推理(NLVR2)、视觉问答(VQAv2)、图像描述(COCO)以及跨模态检索(Flickr30K、COCO)上均取得最先进性能。
引用
@article{arxiv.2208.10442,
title = {Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks},
author = {Wenhui Wang and Hangbo Bao and Li Dong and Johan Bjorck and Zhiliang Peng and Qiang Liu and Kriti Aggarwal and Owais Khan Mohammed and Saksham Singhal and Subhojit Som and Furu Wei},
journal= {arXiv preprint arXiv:2208.10442},
year = {2022}
}
备注
18 pages