基于统一条件模型的自训练视觉语言BERT
计算机视觉与模式识别
2023-01-20 v2 计算与语言
摘要
自然语言BERT以自监督方式使用语料库训练。与自然语言BERT不同,视觉语言BERT需要配对数据训练,这限制了VL-BERT预训练的规模。我们提出一种自训练方法,允许从未标注图像数据训练VL-BERT。所提方法始于我们的统一条件模型——一种可执行零样本条件生成的视觉语言BERT模型。给定不同条件,该统一条件模型可生成图像描述、密集图像描述甚至问题。我们使用标注图像数据训练教师模型,并用训练好的模型在未标注图像数据上生成伪描述。随后我们将标注数据与伪标注数据结合训练学生模型。通过将学生模型作为新教师迭代该过程。利用所提自训练方法及仅300k未标注额外数据,我们取得了与用300万额外图像数据训练的相似模型规模模型相当甚至更优的性能。
引用
@article{arxiv.2201.02010,
title = {Self-Training Vision Language BERTs with a Unified Conditional Model},
author = {Xiaofeng Yang and Fengmao Lv and Fayao Liu and Guosheng Lin},
journal= {arXiv preprint arXiv:2201.02010},
year = {2023}
}