基于迭代实验编程的大型多模态模型自动基准测试
人工智能
2024-06-19 v1 计算与语言
计算机视觉与模式识别
摘要
评估大型多模态模型(LMM)的能力通常需要创建针对性的评估。在当前,构建新基准需要为每个特定分析进行大量手动工作。这使得评估过程繁琐且昂贵。本文提出了 APEx(Automatic Programming of Experiments),即大型多模态模型的自动实验编程框架,这是首个用于 LMM 自动基准测试的框架。给定一个以自然语言表达的研究问题,APEx 利用大语言模型(LLM)和预指定工具库,为所需的模型生成一组实验,并逐步编译科学报告。该报告驱动测试程序:基于当前调查状态,APEx 选择执行哪些实验以及结果是否足以得出结论。最后,LLM 修订报告,将结果以自然语言呈现给用户。由于其模块化,本框架在新工具可用时具有灵活性和可扩展性。实证上,APEx 在再现现有研究的同时,允许进行任意分析和假设检验。
引用
@article{arxiv.2406.12321,
title = {Automatic benchmarking of large multimodal models via iterative experiment programming},
author = {Alessandro Conti and Enrico Fini and Paolo Rota and Yiming Wang and Massimiliano Mancini and Elisa Ricci},
journal= {arXiv preprint arXiv:2406.12321},
year = {2024}
}
备注
31 pages, 6 figures, code is available at https://github.com/altndrr/apex