TASTE:面向 AI 生成图形设计的设计师标注多维偏好数据集
计算机视觉与模式识别
2026-05-21 v1 人工智能
应用统计
摘要
文本到图像模型可按生产规模生成图形设计,但其监督来自单一整体判断的照片风格偏好数据。设计师在评估时沿多个独立轴线进行,包括排版、视觉层次、色彩和谐、布局和简报忠诚度,单个标签会折叠这些维度。我们发布 TASTE(Typography, Aesthetics, Spatial, Tone, Etc.):十名专业设计师对四个当前文本到图像模型的输出在九个标准线上进行排序,涵盖两个互斥的队列,得到每个标准 1,600 条评分,外加每图像的幻觉标记。我们随数据提供三项贡献:(1)一个以 Kendall's tau、多数概率和 Condorcet 循环对抗 exact iid-uniform 原假设(p=4, R=5)的 criterion-agnostic 信号测试框架,将设计师对图形设计的一致性置于食物和电影偏好以及照片图像质量之间;TASTE 的每个标准都拒绝随机评者原假设;(2)我们基准中的任何预训练系统,包括 3B 至 33B 参数的六个开源 VLM 评判器和三款专用 T2I 评分器(HPSv2.1、PickScore-v1、LAION-Aesthetic-V2),均未超过 0.55 的宏观一致性(与 5 位设计师多数派的 0.741 单评者上限相近);VLM 评判器在位置偏差与内容敏感性之间进行权衡,规模化沿此边界前进,却未提升准确性;(3)在 TASTE 上训练的小型两两差异头可达 0.611,将约一半的差距缩小至 0.741 的单评者上限。
引用
@article{arxiv.2605.20731,
title = {TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design},
author = {Haonan Zhu and Elad Hirsch and Alexandria Minetti and Allison Nulty and Purvanshi Mehta},
journal= {arXiv preprint arXiv:2605.20731},
year = {2026}
}