FrEVL:利用冻结预训练嵌入实现高效视觉语言理解
计算机视觉与模式识别
2025-08-07 v1 计算与语言
摘要
视觉语言模型的部署受限于巨大的计算需求。我们提出FrEVL,一个探索冻结预训练嵌入是否能支持有效视觉语言理解的框架。我们的分析表明,冻结嵌入包含丰富的判别性任务信息,在标准基准测试中仅使用68.4M可训练参数即可实现85%至95%的尖峰值性能。这一性能差异揭示了一个关键见解:冻结嵌入的有效性取决于预训练目标与下游任务需求之间的对齐程度。计入嵌入提取的端到端计算后,FrEVL可实现2.3倍的加速,并实现52%的能耗降低,适用于可预计算输入的场景或当部署约束超过细微性能提升时。我们的评估为实践者提供了关于冻结嵌入方法何时代表可行的全模型部署替代方案的指导。我们将发布完整的实现和评估框架,以促进高效多模态理解进一步研究。
引用
@article{arxiv.2508.04469,
title = {FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding},
author = {Emmanuelle Bourigault and Pauline Bourigault},
journal= {arXiv preprint arXiv:2508.04469},
year = {2025}
}
备注
8 pages, 4 figures