面向视觉问答的LXMERT模型压缩
计算机视觉与模式识别
2023-10-25 v1 计算与语言
机器学习
摘要
诸如LXMERT等大规模预训练模型因学习文本-图像对的跨模态表示以用于视觉-语言任务而日益流行。根据彩票假设,NLP与计算机视觉模型包含可独立训练至完整性能的小型子网络。本文中,我们结合这些观察,评估在VQA任务上微调LXMERT时是否存在此类可训练子网络。此外,我们通过考察在不显著损失精度前提下可剪枝的程度,进行了模型规模的成本-收益分析。我们的实验结果表明,LXMERT可有效剪枝40%–60%的规模,而精度损失仅为3%。
引用
@article{arxiv.2310.15325,
title = {LXMERT Model Compression for Visual Question Answering},
author = {Maryam Hashemi and Ghazaleh Mahmoudi and Sara Kodeiri and Hadi Sheikhi and Sauleh Eetemadi},
journal= {arXiv preprint arXiv:2310.15325},
year = {2023}
}
备注
To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit