GenCeption:利用无标签单模态数据评估视觉大语言模型
计算与语言
2025-03-07 v4 人工智能
机器学习
摘要
多模态大语言模型 (MLLMs) 通常使用昂贵的标注多模态基准进行评估,这些基准往往滞后于 MLLM 评估快速发展的需求。本文概述并验证了 GenCeption,这是一种新颖的无标注评估方法,仅需单模态数据即可测量模态间语义连贯性,并反向评估 MLLMs 产生幻觉的倾向。这种方法消除了对昂贵数据标注的需求,最小化了训练数据污染的风险,预计会导致基准饱和速度变慢,并避免新兴能力的错觉。受 DrawCeption 游戏启发,GenCeption 从非文本样本开始,并通过迭代描述和生成步骤进行。迭代过程中的语义漂移使用 GC@T 指标进行量化。虽然 GenCeption 主要适用于各种模态的 MLLMs,但本文侧重于其在视觉大语言模型 (VLLMs) 上的实现和验证。基于 GenCeption 方法,我们建立了用于评估 VLLMs 的 MMECeption 基准,并比较了几种流行 VLLMs 与人类标注者的性能。我们的实证结果验证了 GenCeption 的有效性,表明其与既定的 VLLM 基准具有很强的相关性。VLLMs 仍然显著落后于人类表现,尤其在文本密集型任务上表现挣扎。
引用
@article{arxiv.2402.14973,
title = {GenCeption: Evaluate Vision LLMs with Unlabeled Unimodal Data},
author = {Lele Cao and Valentin Buchner and Zineb Senane and Fangkai Yang},
journal= {arXiv preprint arXiv:2402.14973},
year = {2025}
}
备注
Published by Computer Speech & Language (https://doi.org/10.1016/j.csl.2025.101785). Source code and Leaderboard: https://github.com/llcresearch/GenCeption