VLM 评判只能排序不能评分:多模态评估中的任务相关不确定性
机器学习
2026-04-30 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
视觉语言模型(VLM)日益被用作多模态系统的自动评判,但其分数无法提供可靠性指示。我们通过构成预测,将评判的点分数转换为仅使用 score-token log 概率的校准预测区间的分布无关框架进行了此问题的研究。我们提出了首个系统性分析,将构成预测应用于 VLM 作为评判器,覆盖 3 个评判器和 14 个视觉任务类别。我们的结果表明,评估不确定性在任务相关性方面具有显著性:在审美和自然图像任务中,区间覆盖约 40% 的分数范围,而在图表和数学推理任务中扩展至约 70%,从而为多模态评估量化可靠性图。我们进一步识别了一种标准评估指标无法捕捉的失效模式,即排序-评分脱钩现象:评判器在保持高排序相关性的同时,产生宽广且缺乏信息的区间,正确排序但未分配可靠的绝对分数。最后,我们表明区间宽度主要由任务难度和标注质量驱动,即相同的评判器和方法在干净、多标注者标题基准测试上产生 4.5 倍更窄的区间。代码:https://github.com/divake/VLM-Judge-Uncertainty
引用
@article{arxiv.2604.25235,
title = {VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation},
author = {Divake Kumar and Sina Tayebati and Devashri Naik and Ranganath Krishnan and Amit Ranjan Trivedi},
journal= {arXiv preprint arXiv:2604.25235},
year = {2026}
}