中文

FREE:基于早期退出的快速且鲁棒的视觉语言模型

机器学习 2025-06-10 v1 计算机视觉与模式识别

摘要

近年来,视觉语言模型 (VLM) 在视觉语言任务中展现出显著的性能提升。然而,其庞大的数据规模在推理延迟受到关注的实际应用中构成挑战。为此,本文提出在 VLM 中采用早期退出 (EE) 策略。然而,在 VLM 中训练退出分类器具有挑战,尤其是当训练数据有限时。为此,我们引入 FREE,一种基于 GAN 框架内的对抗训练方法。此方法中,每个退出由一个 transformer 层和一个分类器组成。transformer 层通过对抗训练产生与最终层相似的特征表示,而特征分类器则作为判别器。我们的方法专注于执行输入自适应推理,以在性能几乎不下降的情况下提高推理速度。实验结果表明,我们的方法在增强准确率和模型鲁棒性方面有效,通过缓解过度思考现象以及我们所指出的危机中期问题。我们实验验证,我们的方法通过超过 1.51 倍的速度加快推理过程,同时保持相当的性能。源代码已可在 https://github.com/Div290/FREE 获取。

关键词

引用

@article{arxiv.2506.06884,
  title  = {FREE: Fast and Robust Vision Language Models with Early Exits},
  author = {Divya Jyoti Bajpai and Manjesh Kumar Hanawal},
  journal= {arXiv preprint arXiv:2506.06884},
  year   = {2025}
}

备注

To appear at the Association of Computational Linguistics (ACL) 2025 Conference