视觉语言模型能否评估图形设计美学?——基于基准、评估与数据集的视角
计算机视觉与模式识别
2026-03-03 v1
摘要
评估图形设计的美学质量是视觉传达的核心任务,但在视觉语言模型(VLM)中仍属未探索领域。我们研究VLMs是否能够以类似人类的方式评估设计美学。现有工作面临三个关键局限:基准局限于狭窄原则和粗糙评估协议;缺乏系统性VLM比较;以及为模型改进而缺乏训练数据。本文我们引入AesEval-Bench,一个涵盖四个维度、十二个指标和三个完全可量化任务的综合性基准:美学判断、区域选择和精确定位。然后,我们系统评估了专有、开源和推理增强型VLMs,揭示了其在美学评估这一细致需求方面存在明显差距。此外,我们构建了一个训练数据集,用于在此领域微调VLMs,利用人工指导的VLM标记大规模生成任务标签,并通过指标导向的推理将抽象指标与具体设计区域关联。我们工作的整体框架为图形设计的美学质量评估奠定了第一个系统框架。我们的代码和数据集将在https://github.com/arctanxarc/AesEval-Bench 上发布。
引用
@article{arxiv.2603.01083,
title = {Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective},
author = {Arctanx An and Shizhao Sun and Danqing Huang and Mingxi Cheng and Yan Gao and Ji Li and Yu Qiao and Jiang Bian},
journal= {arXiv preprint arXiv:2603.01083},
year = {2026}
}
备注
ICLR 2026