通过多模态贝叶斯提示集合校准 MLLM 评判器
计算机视觉与模式识别
2025-09-11 v1 计算与语言
摘要
多模态大语言模型(MLLM)正在越来越多地用于评估文本到图像(TTI)生成系统,提供基于视觉和文本上下文的自动判断。然而,这些“评判”模型常常受偏见、过度自信以及在不同图像领域表现不一致。虽然提示集合在单模态、文本-only 设置中显示出缓解这些问题的潜力,但我们的实验表明标准集合方法无法有效地为 TTI 任务所泛化。为解决这些限制,我们提出一种新的多模态方法,称为多模态贝叶斯混合提示集合(MMB)。我们的方法使用增强了图像聚类的数据驱动贝叶斯提示集合方法,使评判器能够根据每个样本的视觉特征动态分配提示权重。我们表明,MMB 在两对偶偏好判断中提高了准确性,并显著增强了校准效果,使更容易把握评判器的真实不确定性。在两个 TTI 基准测试中,HPSv2 和 MJBench 上的评估表明,MMB 在与人类注释一致性和校准方面优于现有基线。我们的发现突显了针对评判器校准的多模态特定策略的重要性,并为可靠的大规模 TTI 评估指明了前景之路。
引用
@article{arxiv.2509.08777,
title = {Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles},
author = {Eric Slyman and Mehrab Tanjim and Kushal Kafle and Stefan Lee},
journal= {arXiv preprint arXiv:2509.08777},
year = {2025}
}
备注
17 pages, 8 figures, Accepted at ICCV 2025