ELEVATER:用于评估语言增强视觉模型的基准与工具包
计算机视觉与模式识别
2022-10-14 v6 计算与语言
机器学习
摘要
从自然语言监督中学习视觉表示近来在若干开创性工作中展现出巨大前景。一般而言,这些语言增强视觉模型对多种数据集和任务表现出很强的可迁移性。然而,由于缺乏易用的评估工具包和公开基准,评估这些模型的可迁移性仍然具有挑战性。为此,我们构建了 ELEVATER(Evaluation of Language-augmented Visual Task-level Transfer,语言增强视觉任务级迁移评估),首个用于评估(预训练)语言增强视觉模型的基准与工具包。ELEVATER 由三部分组成。(i)数据集。作为下游评估套件,其包含 20 个图像分类数据集和 35 个目标检测数据集,每个都增强了外部知识。(ii)工具包。开发了一个自动超参数调优工具包以促进模型在下游任务上的评估。(iii)指标。采用多种评估指标来衡量样本效率(零样本与少样本)和参数效率(线性探测与全模型微调)。ELEVATER 是 Computer Vision in the Wild (CVinW) 的一个平台,并已公开发布于 https://computer-vision-in-the-wild.github.io/ELEVATER/。
引用
@article{arxiv.2204.08790,
title = {ELEVATER: A Benchmark and Toolkit for Evaluating Language-Augmented Visual Models},
author = {Chunyuan Li and Haotian Liu and Liunian Harold Li and Pengchuan Zhang and Jyoti Aneja and Jianwei Yang and Ping Jin and Houdong Hu and Zicheng Liu and Yong Jae Lee and Jianfeng Gao},
journal= {arXiv preprint arXiv:2204.08790},
year = {2022}
}
备注
NeurIPS 2022 (Datasets and Benchmarks Track). The first two authors contribute equally. Benchmark page: https://computer-vision-in-the-wild.github.io/ELEVATER/