FREE:基于早期退出的快速且鲁棒的视觉语言模型
机器学习
2025-06-10 v1 计算机视觉与模式识别
摘要
近年来,视觉语言模型 (VLM) 在视觉语言任务中展现出显著的性能提升。然而,其庞大的数据规模在推理延迟受到关注的实际应用中构成挑战。为此,本文提出在 VLM 中采用早期退出 (EE) 策略。然而,在 VLM 中训练退出分类器具有挑战,尤其是当训练数据有限时。为此,我们引入 FREE,一种基于 GAN 框架内的对抗训练方法。此方法中,每个退出由一个 transformer 层和一个分类器组成。transformer 层通过对抗训练产生与最终层相似的特征表示,而特征分类器则作为判别器。我们的方法专注于执行输入自适应推理,以在性能几乎不下降的情况下提高推理速度。实验结果表明,我们的方法在增强准确率和模型鲁棒性方面有效,通过缓解过度思考现象以及我们所指出的危机中期问题。我们实验验证,我们的方法通过超过 1.51 倍的速度加快推理过程,同时保持相当的性能。源代码已可在 https://github.com/Div290/FREE 获取。
引用
@article{arxiv.2506.06884,
title = {FREE: Fast and Robust Vision Language Models with Early Exits},
author = {Divya Jyoti Bajpai and Manjesh Kumar Hanawal},
journal= {arXiv preprint arXiv:2506.06884},
year = {2025}
}
备注
To appear at the Association of Computational Linguistics (ACL) 2025 Conference