基于简化多模态预训练模型的多阶段预训练
计算与语言
2021-08-02 v1
摘要
多模态预训练模型(如 LXMERT)在下游任务中取得了优异的结果。然而,当前的预训练模型需要大量训练数据且模型规模巨大,难以在低资源场景下应用。如何在更少预训练数据与更小模型规模的前提下,获得与更大模型相当甚至更优的性能,已成为一个重要问题。本文提出一种新的多阶段预训练(MSP)方法,利用文本与图像中从词、短语到句子的不同粒度信息,分阶段预训练模型。我们还设计了若干适用于不同阶段信息粒度的预训练任务,以从有限语料中高效捕获多样知识。我们以简化版 LXMERT(LXMERT-S)作为 MSP 方法的测试平台,其参数仅为原始 LXMERT 模型的 45.9%,预训练数据为原始的 11.76%。实验结果表明,我们的方法在所有下游任务中取得了与原始 LXMERT 模型相当的性能,并在图文检索任务中优于原始模型。
引用
@article{arxiv.2107.14596,
title = {Multi-stage Pre-training over Simplified Multimodal Pre-training Models},
author = {Tongtong Liu and Fangxiang Feng and Xiaojie Wang},
journal= {arXiv preprint arXiv:2107.14596},
year = {2021}
}
备注
10 pages, 4 figures