在视觉与语言模型中寻找彩票中奖票
计算机视觉与模式识别
2021-12-16 v2 计算与语言
机器学习
摘要
大规模预训练近来革新了视觉与语言(VL)研究。诸如 LXMERT 和 UNITER 等模型在广泛的 VL 任务上显著提升了当前最优水平。然而,此类模型中大量的参数阻碍了它们的实际应用。与此同时,关于彩票假设(LTH)的研究表明,深度神经网络包含小型匹配子网络,当独立训练时可以达到与稠密网络相当甚至更好的性能。在本工作中,我们进行了首个实证研究,以评估此类可训练子网络是否也存在于预训练的 VL 模型中。我们使用 UNITER 作为主要测试平台(也在 LXMERT 和 ViLT 上测试),并整合了 7 个具有代表性的 VL 任务进行实验,包括视觉问答、视觉常识推理、视觉蕴含、指代表达理解、图文检索、GQA 和 NLVR。通过综合分析,我们将主要发现总结如下:()难以找到严格匹配完整模型性能的亚网络。然而,我们可以在 50%–70% 稀疏度下找到维持完整模型 99% 准确率的“松弛”中奖票。()通过任务特定剪枝找到的子网络向其他任务的迁移效果相当好,而在预训练任务上以 60%/70% 稀疏度找到的子网络可普遍迁移,在所有任务上平均分别匹配完整模型 98%/96% 的准确率。()除 UNITER 外,LXMERT 和 ViLT 等其他模型也能玩彩票中奖票游戏。然而,我们能为 ViLT 达到的最高稀疏度远低于 LXMERT 和 UNITER(30% 对比 70%)。()当使用其他训练方法(例如对抗训练)时,LTH 同样适用。
引用
@article{arxiv.2104.11832,
title = {Playing Lottery Tickets with Vision and Language},
author = {Zhe Gan and Yen-Chun Chen and Linjie Li and Tianlong Chen and Yu Cheng and Shuohang Wang and Jingjing Liu and Lijuan Wang and Zicheng Liu},
journal= {arXiv preprint arXiv:2104.11832},
year = {2021}
}
备注
Accepted to AAAI 2022