利用自由语言建模加速视觉-语言预训练
计算机视觉与模式识别
2023-03-27 v1
摘要
视觉-语言预训练(VLP)的最先进方法取得了卓越性能,但存在因收敛缓慢和训练时间长(尤其是在大规模网络数据集上)导致的高训练成本问题。训练效率的一个本质障碍在于掩码语言建模(MLM)中纠缠在一起的预测率(用于重构的 token 百分比)与破坏率(被破坏的 token 百分比),即,适当的破坏率是以排除大部分输出 token 参与预测损失为代价获得的。为加速 VLP 收敛,我们提出一种新的预训练任务,即自由语言建模(FLM),其能以任意破坏率实现 100% 的预测率。FLM 成功地将预测率从与破坏率的绑定中解放出来,同时允许为每个待预测 token 定制破坏区间。在相同 GPU 时间内,FLM 训练的模型通过更灵活地利用双向上下文而被鼓励学得更好更快。大量实验表明,与基于 MLM 的方法相比,FLM 可实现令人印象深刻的 2.5 倍预训练时间缩减,同时在视觉-语言理解与生成任务上保持有竞争力的性能。代码将公开于 https://github.com/TencentARC/FLM。
引用
@article{arxiv.2303.14038,
title = {Accelerating Vision-Language Pretraining with Free Language Modeling},
author = {Teng Wang and Yixiao Ge and Feng Zheng and Ran Cheng and Ying Shan and Xiaohu Qie and Ping Luo},
journal= {arXiv preprint arXiv:2303.14038},
year = {2023}
}
备注
To appear in CVPR 2023