中文

VisJudge-Bench:可视化的美学与质量评估基准

计算与语言 2026-03-03 v3 人工智能 计算机视觉与模式识别

摘要

可视化是一种特定领域却广泛使用的图像形式,是将复杂数据转化为直观洞察的有效方式,其价值取决于数据是否忠实呈现、清晰传达以及美学设计。在评估可视化质量方面具有挑战:与自然图像不同,它需要同时判断数据编码准确性、信息表达性和视觉美学。尽管多模态大型语言模型(MLLM)在自然图像的美学评估方面表现出色,但尚无用于衡量其在评估可视化美学和质量方面能力的系统性基准。为此,我们提出VisJudge-Bench,这是评估MLLM在评估可视化美学和质量方面性能的第一个全面基准。它包含3,090个来自真实场景的专家标注样本,覆盖单张可视化、多个可视化和仪表板,涵盖32种图表类型。对该基准进行系统性测试发现,即便是最先进的MLLM(如GPT-5)在判断方面仍与人类专家存在显著差距,其平均绝对误差(MAE)为0.553,与人类评分的相关性仅为0.428。为此,我们提出VisJudge,一个专为可视化美学和质量评估而设计的模型。实验结果表明,VisJudge显著缩小了与人类判断之间的差距,将MAE降至0.421(降低23.9%),将与人类专家的一致性提升至0.687(提升60.5%),远超GPT-5。该基准已发布于https://github.com/HKUSTDial/VisJudgeBench。

关键词

引用

@article{arxiv.2510.22373,
  title  = {VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations},
  author = {Yupeng Xie and Zhiyang Zhang and Yifan Wu and Sirong Lu and Jiayi Zhang and Zhaoyang Yu and Jinlin Wang and Sirui Hong and Bang Liu and Chenglin Wu and Yuyu Luo},
  journal= {arXiv preprint arXiv:2510.22373},
  year   = {2026}
}

备注

62 pages, 27 figures, 8 tables. Accepted at ICLR 2026