Task Me Anything
计算机视觉与模式识别
2025-01-28 v2 人工智能
摘要
大型多模态语言模型 (MLM) 的基准测试现在旨在同时评估模型的通用能力,而不仅仅是针对特定能力进行评估。因此,当开发人员希望确定为其应用程序选择哪些模型时,他们会感到基准测试数量让人眼花缭乱,难以确定哪些基准测试结果最能反映其特定用例。本文引入了 Task-Me-Anything,一款基准测试生成引擎,可为用户的需求量身定制基准测试。Task-Me-Anything 维护了可扩展的视觉资产分类学,可程序化生成大量任务实例。此外,它在计算预算内高效地解决了关于 MLM 性能的用户查询。它包含 113 万张图片、1 万段视频、2000 个 3D 对象资产,超过 365 个对象类别、655 个属性和 335 个关系。它可以生成 7.5 亿张图片/视频问答对,旨在评估 MLM 的感知能力。Task-Me-Anything 揭示了关键见解:开源 MLM 在对象和属性识别方面表现出色,但在空间和时间理解方面存在不足;每个模型都呈现出独特的优势和不足;更大的模型通常表现更好,但也存在例外情况;且 GPT4o 在识别旋转/移动对象和区分颜色方面存在挑战。
引用
@article{arxiv.2406.11775,
title = {Task Me Anything},
author = {Jieyu Zhang and Weikai Huang and Zixian Ma and Oscar Michel and Dong He and Tanmay Gupta and Wei-Chiu Ma and Ali Farhadi and Aniruddha Kembhavi and Ranjay Krishna},
journal= {arXiv preprint arXiv:2406.11775},
year = {2025}
}
备注
NeurIPS 2024 Track on Datasets and Benchmarks. Website: https://www.task-me-anything.org