细察视觉-语言预训练模型的鲁棒性
计算机视觉与模式识别
2021-04-01 v2 计算与语言
摘要
大规模预训练多模态Transformer,如ViLBERT和UNITER,已将视觉-语言(V+L)研究的技术水平推向新高度。尽管在标准任务上取得了令人印象深刻的性能,迄今为止这些预训练模型的鲁棒性仍不清楚。为探究此问题,我们对现有预训练模型在4种不同类型的V+L特定模型鲁棒性上进行了大量细致评估:(i)语言变异;(ii)逻辑推理;(iii)视觉内容操纵;(iv)答案分布偏移。有趣的是,通过标准模型微调,预训练的V+L模型已表现出优于许多特定任务最先进方法的鲁棒性。为进一步增强模型鲁棒性,我们提出Mango,一种通用且高效的方法,在嵌入空间中学习一个多模态对抗噪声生成器(Multimodal Adversarial Noise GeneratOr)以欺骗预训练V+L模型。与以往聚焦于单一鲁棒性类型的研究不同,Mango与任务无关,并能对预训练模型在旨在评估广泛鲁棒性层面的多种任务上实现普适的性能提升。综合实验表明,Mango在9个鲁棒性基准中的7个上达到了新的SOTA,以显著优势超越现有方法。作为首个关于V+L鲁棒性的综合研究,本工作将预训练模型的鲁棒性置于更清晰的焦点,为未来研究指明新方向。
引用
@article{arxiv.2012.08673,
title = {A Closer Look at the Robustness of Vision-and-Language Pre-trained Models},
author = {Linjie Li and Zhe Gan and Jingjing Liu},
journal= {arXiv preprint arXiv:2012.08673},
year = {2021}
}