基于解耦编码器-解码器网络的视觉-语言预训练中的计划采样
计算机视觉与模式识别
2021-01-28 v1 计算与语言
摘要
尽管基于 BERT 的编码器在视觉-语言(VL)理解方面的预训练已取得令人印象深刻的进展,但针对 VL 理解与生成任务的通用编码器-解码器预训练仍具挑战性。其困难源于两大学科内在的不同特性,例如 VL 理解任务利用跨模态间无限制的消息传递,而生成任务仅采用视觉到文本的消息传递。本文从编码器-解码器结构的两流解耦设计出发,引入两个解耦的跨模态编码器与解码器分别执行各类代理任务,以实现 VL 理解与生成的同步预训练。此外,在 VL 预训练中,主流方法是用掩码令牌替换部分输入视觉/词令牌并迫使多模态编码器/解码器重建原始令牌,但在下游任务微调时并不涉及掩码令牌。作为替代,我们提出一种初步的计划采样策略,通过两遍方式的编码器-解码器预训练优雅地缓解此类差异。大量实验表明,我们的预训练编码器-解码器在四个 VL 理解与生成下游任务微调时具有引人注目的泛化能力。源代码见 \url{https://github.com/YehLi/TDEN}。
引用
@article{arxiv.2101.11562,
title = {Scheduled Sampling in Vision-Language Pretraining with Decoupled Encoder-Decoder Network},
author = {Yehao Li and Yingwei Pan and Ting Yao and Jingwen Chen and Tao Mei},
journal= {arXiv preprint arXiv:2101.11562},
year = {2021}
}
备注
AAAI 2021; Code is publicly available at: https://github.com/YehLi/TDEN