Inter-Intra模态度量:视觉语言模型精调结果的预测镜头
计算机视觉与模式识别
2025-08-05 v2
摘要
大型视觉语言基础模型的精调仍是未被充分探索的领域,尤其是关于其对学习收益和灾难性遗忘的影响。鼓励模态间隙在对比双编码器中的重要性,我们引入Inter-Intra模态度量(IIMM)——一种预测指标,用于量化 intra-modal 图像嵌入相似性与 inter-modal 错位之间的关系。通过对四种最先进视觉语言模型和五种精调技术的广泛实证分析,我们确立了强烈的线性关系:IIMM得分更高的任务在域内性能提升方面表现更好,但在域外性能下降方面更为显著,某些参数高效精调(PEFT)方法显示出严重的遗忘现象。与现有传递性度量相比,IIMM在双编码器模型中对事后精调准确度变化具有显著更强的预测能力。此外,我们提供了理论上界,证明IIMM的变化受到预-精调嵌入分布与 post-精调嵌入分布之间Wasserstein距离的限制,确保其作为预测度量的稳定性和鲁棒性。仅通过一次正向传递目标数据,实践者即可利用这一关键见解来评估模型在精调后预期能否提升。当结合对模型在多样化任务上的性能已有了解时,IIMM进一步增强了对新任务传递性预测的能力,为指导模型适应策略提供了轻量且有效的工具。我们的代码已提供于 https://github.com/mit-ll/IIMM。
引用
@article{arxiv.2407.15731,
title = {The Inter-Intra Modal Measure: A Predictive Lens on Fine-Tuning Outcomes in Vision-Language Models},
author = {Laura Niss and Kevin Vogt-Lowell and Theodoros Tsiligkaridis},
journal= {arXiv preprint arXiv:2407.15731},
year = {2025}
}
备注
Accepted to ICCV 2025