中文

VLUE:评估视觉-语言模型的多任务基准

计算机视觉与模式识别 2022-05-31 v1 计算与语言 机器学习

摘要

视觉-语言预训练(VLP)的近期进展在一系列视觉-语言(VL)任务中展现出令人印象深刻的性能。然而,在衡量社区构建通用多模态智能的进展方面存在若干挑战。首先,大多数下游 VL 数据集使用预训练期间已见过的原始图像进行标注,这可能导致对当前 VLP 模型泛化能力的高估。其次,近期 VLP 工作主要关注绝对性能,而忽视了效率-性能权衡,后者也是衡量进展的重要指标。为此,我们引入视觉-语言理解评估(VLUE)基准,一个用于评估 VLP 模型泛化能力及效率-性能权衡(“Pareto SOTA”)的多任务多维度基准。我们证明,当在分布于不同文化、更多样分布的图像上标注的分布外测试集上测试时,所有 VLP 模型均存在可观的泛化差距。此外,我们发现衡量 VLP 模型的效率-性能权衡可为若干 VLP 设计选择带来互补的见解。我们发布 VLUE 基准以推动构建能很好泛化至预训练期间未见过的更多样图像与概念、且在效率-性能权衡上实用的视觉-语言模型的研究。

关键词

引用

@article{arxiv.2205.15237,
  title  = {VLUE: A Multi-Task Benchmark for Evaluating Vision-Language Models},
  author = {Wangchunshu Zhou and Yan Zeng and Shizhe Diao and Xinsong Zhang},
  journal= {arXiv preprint arXiv:2205.15237},
  year   = {2022}
}

备注

ICML 2022, Benchmark website at https://vlue-benchmark.github.io