中文

视觉审美基准:前沿模型能否判断美好?

计算机视觉与模式识别 2026-05-14 v1 人工智能 人机交互

摘要

多模态大型语言模型(MLLMs)如今被常规部署用于视觉理解、生成和策展。其中相当大比例应用需要明确的审美判断。大多数现有解决方案将该判断简化为对单张图像预测标量分数。我们首先询问,这些分数是否忠实地捕获了比较偏好:在由八位专家注释员进行的受控研究中,基于分数的排序与相同注释员直接比较的结果对齐得很差,而直接排序可显著提高最坏-最佳图像标签之间的注释员间一致性。受此启发,我们引入视觉审美基准(VAB),将审美评估设定为针对候选集合进行比较选择,具有匹配的主题。VAB 包含 400 个任务和 1,195 张图像,覆盖绘画、摄影和插画,标签来源于每个任务中 10 位独立专家注释员的共识。评估 20 个前沿 MLLMs 和 6 个专用视觉质量奖励模型,我们发现最强系统在三个随机排列候选顺序的情况下仅在 26.5% 的任务中正确识别最佳和最差图像,而人类专家实现 68.9%。在 2,000 个专家示例上微调 35B 参数模型可将准确率接近 397B 参数的开放权重模型,表明 VAB 中的比较信号是可迁移的。这些结果暴露了当前多模态模型与专家审美判断之间显而易见的可衡量差距,VAB 提供了第一套基于集合的、以专家为依据的测试平台,可跟踪并缩小这一差距。

关键词

引用

@article{arxiv.2605.12684,
  title  = {Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?},
  author = {Yichen Feng and Yuetai Li and Chunjiang Liu and Yuanyuan Chen and Fengqing Jiang and Yue Huang and Hang Hua and Zhengqing Yuan and Kaiyuan Zheng and Luyao Niu and Bhaskar Ramasubramanian and Basel Alomair and Xiangliang Zhang and Misha Sra and Zichen Chen and Radha Poovendran and Zhangchen Xu},
  journal= {arXiv preprint arXiv:2605.12684},
  year   = {2026}
}

备注

Project page: https://vab.bakelab.ai. Code: https://github.com/BakeLab/Visual-Aesthetic-Benchmark. Dataset: https://huggingface.co/datasets/BakeLab/Visual-Aesthetic-Benchmark