中文

我们能否跨越视觉语言任务预测大型模型的性能?

计算机视觉与模式识别 2025-05-30 v2 计算与语言

摘要

评估大型视觉语言模型(LVLMs)的成本极高,由于高计算开销和任务的多样性。不幸的是,如果我们已经拥有一些观察到的性能分数,可能就能推断出未知的分数。在本研究中,我们提出了一种基于其他LVLMs或任务中已观察性能分数来预测未知性能分数的新框架。我们首先将性能预测建模为矩阵完成任务。具体而言,我们构建一个稀疏性能矩阵 R\boldsymbol{R},其中每个条目 RmnR_{mn} 表示第 mm 个模型在第 nn 个数据集上的性能分数。通过应用带有马尔可夫链蒙特卡罗(MCMC)的概率矩阵分解(PMF),我们可以完成性能矩阵,即预测未知分数。此外,我们基于MCMC估计性能预测的不确定性。实践者可以先对尚未测试的任务进行评估,利用更高的不确定性快速减少预测误差。我们进一步引入了若干改进,以增强处理稀疏观测性能分数场景的PMF。我们的实验表明,PMF在预测未知分数方面具有准确性,对排序评估不确定性估计的可靠性,以及我们增强措施处理稀疏数据方面的有效性。

关键词

引用

@article{arxiv.2410.10112,
  title  = {Can We Predict Performance of Large Models across Vision-Language Tasks?},
  author = {Qinyu Zhao and Ming Xu and Kartik Gupta and Akshay Asthana and Liang Zheng and Stephen Gould},
  journal= {arXiv preprint arXiv:2410.10112},
  year   = {2025}
}

备注

ICML2025. Project page: https://github.com/Qinyu-Allen-Zhao/CrossPred-LVLM