能量基模型与对比学习:探索用于视觉问答的自监督视觉预训练
计算机视觉与模式识别
2022-06-30 v1 计算与语言
机器学习
摘要
干净且多样的有标注数据的匮乏是训练视觉问答(VQA)等复杂模型的主要障碍。关于大型视觉-语言模型的广泛工作已表明,自监督学习对于预训练多模态交互是有效的。在本技术报告中,我们聚焦于视觉表征。我们回顾并评估自监督方法,以利用无标注图像预训练模型,随后我们在允许受控评估与诊断的自定义VQA任务上微调该模型。我们比较能量基模型(EBMs)与对比学习(CL)。尽管EBMs日益流行,其缺乏在下游任务上的评估。我们发现EBMs与CL均可从无标注图像学习表征,从而能用极少标注数据训练VQA模型。在类似CLEVR的简单设定中,我们发现CL表征还改进了系统性泛化,甚至匹配了来自更大的、有监督的ImageNet预训练模型的表征性能。然而,我们发现EBMs由于结果的不稳定性与高变异性而难以训练。尽管EBMs被证明对OOD检测有用,但有监督能量基训练与不确定性校准上的其他结果大体为负。总体而言,CL目前似乎是优于EBMs的可取选项。
引用
@article{arxiv.2206.14355,
title = {EBMs vs. CL: Exploring Self-Supervised Visual Pretraining for Visual Question Answering},
author = {Violetta Shevchenko and Ehsan Abbasnejad and Anthony Dick and Anton van den Hengel and Damien Teney},
journal= {arXiv preprint arXiv:2206.14355},
year = {2022}
}