中文

K-Sort Eval:基于校正 VLM 评判器的高效视觉生成偏好评估

计算机视觉与模式识别 2026-02-11 v1

摘要

视觉生成模型的快速发展催生了更可扩展且更贴合人类偏好的评估方法的需求。虽然众所周知的 Arena 平台通过收集人类投票提供人类偏好评估,但其成本高昂且耗时,本质上限制了其可扩展性。利用视觉语言模型(VLM)作为手动判断的替代方案 presents a 有前景的解决方案。然而,VLM 内在的幻觉与偏见阻碍了与人类偏好的对齐,从而损害了评估的可靠性。此外,静态评估方法导致效率低下。本文提出 K-Sort Eval,一个可靠且高效的基于 VLM 的评估框架,集成后验校正与动态匹配。具体而言,我们从数千个人类投票中构建了 K-Sort Arena 的高质量数据集,其中每个实例包含 K 个模型的输出与排名。评估新模型时,其需与现有模型进行 (K+1) wise 自由竞争比较,VLM 提供排名。为增强对齐性与可靠性,我们提出了后验校正方法,基于 VLM 预测与人类监督之间的一致性,自适应校正贝叶斯更新中的后验概率。此外,我们提出了动态匹配策略,在不确定性与多样性之间进行平衡,以最大化每个比较的预期收益,从而确保更高效的评估。大量实验表明,K-Sort Eval 能提供与 K-Sort Arena 一致的评估结果,通常只需少于 90 次模型运行,显示其既高效又可靠。

关键词

引用

@article{arxiv.2602.09411,
  title  = {K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge},
  author = {Zhikai Li and Jiatong Li and Xuewen Liu and Wangbo Zhao and Pan Du and Kaicheng Zhou and Qingyi Gu and Yang You and Zhen Dong and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2602.09411},
  year   = {2026}
}

备注

ICLR 2026. Code is available at: https://github.com/zkkli/K-Sort-Eval