通过访谈提升 MLLM 基准测试效率
计算与语言
2025-10-07 v2
摘要
多模态大语言模型(MLLM)的快速发展催生了广泛的 MLLM 应用,并涌现出大量基准数据集以评估 MLLM 的能力。然而,在大规模数据上进行全覆盖问答测试是资源密集且耗时的。为了解决这一问题,我们提出了 MLLM 访谈(MITV)策略,旨在通过提问较少的问题快速获取 MLLM 性能指标。首先,我们构建了访谈数据集,该数据集建立在现有的 MLLM 评估数据集之上,通过根据部分典型 MLLM 在该数据集上的表现添加难度标签而建成。其次,我们提出了一种 MLLM 访谈策略,通过提问少量主题获取大模型的初始性能状况,然后不断尝试测试模型的极限。通过大量实验,结果表明本文提出的 MITV 策略在 MLLM 基准数据集上表现良好,能够通过少量问答更快地获取模型评估能力。
引用
@article{arxiv.2506.00883,
title = {Improve MLLM Benchmark Efficiency through Interview},
author = {Farong Wen and Yijin Guo and Junying Wang and Jiaohao Xiao and Yingjie Zhou and Ye Shen and Qi Jia and Chunyi Li and Zicheng Zhang},
journal= {arXiv preprint arXiv:2506.00883},
year = {2025}
}