VisIT-Bench:受真实使用启发的视觉语言指令遵循基准
计算与语言
2023-12-27 v4 人工智能
计算机视觉与模式识别
摘要
我们引入 VisIT-Bench(Visual InsTruction Benchmark),一个用于评估面向真实使用的指令遵循视觉语言模型的基准。我们的出发点是策划 70 个“指令族”,我们设想指令微调的视觉语言模型应能处理这些指令族。超越 VQAv2 与 COCO 等评估,任务涵盖从基础识别到游戏游玩与创意生成。策划之后,我们的数据集包含 592 个测试查询,每个均带有人工撰写的指令条件化描述。这些描述揭示了指令特定因素,例如,对于询问轮椅用户商店门面可达性的指令,该指令条件化描述会刻画坡道/潜在障碍。这些描述使得:1)为每个实例收集人工验证的参考输出;以及 2)使用仅文本 LLM 自动评估候选多模态生成,并与人类判断对齐。我们利用人工与自动评估量化模型与参考之间的质量差距;例如,性能最优的指令遵循模型仅在 27% 的比较中胜出 GPT-4 参考。VisIT-Bench 为动态参与式,实践者只需在项目网站提交其模型响应;数据、代码与排行榜见 visit-bench.github.io。
引用
@article{arxiv.2308.06595,
title = {VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use},
author = {Yonatan Bitton and Hritik Bansal and Jack Hessel and Rulin Shao and Wanrong Zhu and Anas Awadalla and Josh Gardner and Rohan Taori and Ludwig Schmidt},
journal= {arXiv preprint arXiv:2308.06595},
year = {2023}
}
备注
Accepted to NeurIPS 2023, Datasets and Benchmarks. Website: https://visit-bench.github.io/