DesignSense:面向图形布局生成的人类偏好数据集与奖励建模框架
计算机视觉与模式识别
2026-03-02 v1 人工智能
摘要
图形布局是一种在不同渠道中用于视觉传播的重要且富有吸引力的媒介。虽然最近的布局生成模型已展示出令人印象深刻的能力,但它们经常无法与细腻的人类审美判断保持一致。现有的偏好数据集和基于文本到图像生成训练的奖励模型无法通用于布局评估,因为相同元素在空间布局中的排列方式决定了质量。为解决这一关键问题,我们引入了 DesignSense-10k,这是一个包含 10,235 组人类标注偏好对的大型数据集,用于图形布局评估。我们提出了一个五阶段的精选管道,通过语义分组、布局预测、筛选、聚类和 VLM 基于细化来生成在不同宽高比下视觉连贯的布局转换,产生高质量的比较对。人类偏好使用 4 类方案 (左、右、两者都好、两者都差) 进行标注,以捕捉主观模糊性。利用这个数据集,我们训练了 DesignSense,一种基于视觉-语言模型的分类器,在全面的评估指标上显著优于现有开源和专有模型(相对于最强的专有基线提高了 54.6% 的宏 F1 分数)。我们的分析显示,前沿 VLM 在完整的四分类任务中仍不可靠,出现灾难性失败,这凸显了需要专门的、以偏好为导向的模型的必要性。除了数据集之外,我们的奖励模型 DesignSense 在布局生成中带来了实际的下游收益。在使用我们的评判器进行 RL 训练时,生成器的获胜率提高了约 3%;而推理时扩展,即生成多个候选者并选择最佳者,提供了 3.6% 的改进。这些结果凸显了针对布局感知的专门化、偏好导向模型对实际布局生成质量的实际影响。
引用
@article{arxiv.2602.23438,
title = {DesignSense: A Human Preference Dataset and Reward Modeling Framework for Graphic Layout Generation},
author = {Varun Gopal and Rishabh Jain and Aradhya Mathur and Nikitha SR and Sohan Patnaik and Sudhir Yarram and Mayur Hemani and Balaji Krishnamurthy and Mausoom Sarkar},
journal= {arXiv preprint arXiv:2602.23438},
year = {2026}
}
备注
14 pages, 3 figures