面向视觉问答的视觉-语言预训练模型压缩与去偏
计算机视觉与模式识别
2023-10-13 v2
摘要
尽管视觉-语言预训练模型(VLPs)在传统 VQA 任务上表现出色,但它们仍存在两个问题:首先,VLPs 倾向于依赖数据集中的语言偏置,且无法泛化到分布外(OOD)数据。其次,它们在内存占用和计算方面效率低下。尽管在这两个问题上都取得了可喜的进展,但现有大多数工作独立地解决它们。为了促进 VLP 在 VQA 任务中的应用,迫切需要联合研究 VLP 压缩与 OOD 鲁棒性,然而这尚未被探索。本文研究 VLP 是否可以通过搜索稀疏且鲁棒的子网络来同时进行压缩与去偏。为此,我们系统地研究了训练与压缩流水线的设计以搜索子网络,以及稀疏度在不同模态特定模块间的分配。我们的实验涉及 3 个 VLPs、2 种压缩方法、4 种训练方法、2 个数据集以及一系列稀疏度级别和随机种子。结果表明,确实存在稀疏且鲁棒的子网络,它们与去偏后的完整 VLP 具有竞争力,并且在 OOD 数据集 VQA-CP v2 和 VQA-VS 上以更少的参数明显优于去偏 SoTAs。代码可在 https://github.com/PhoebusSi/Compress-Robust-VQA 找到。
引用
@article{arxiv.2210.14558,
title = {Compressing And Debiasing Vision-Language Pre-Trained Models for Visual Question Answering},
author = {Qingyi Si and Yuanxin Liu and Zheng Lin and Peng Fu and Weiping Wang},
journal= {arXiv preprint arXiv:2210.14558},
year = {2023}
}
备注
EMNLP 2023