探索AI顺从性:为何生成纯色图像比生成赛博朋克图像更难?
计算机视觉与模式识别
2026-05-12 v2 人工智能
摘要
近期生成式AI的进展在复杂内容创建方面展现出人类水平的性能。然而,我们发现存在一种“简单性悖论”:能够渲染复杂场景的模型往往在简单、低熵任务(如生成均匀纯色图像)方面失败。我们认为这属于与不可控涌现能力相关的系统性失效。随着模型规模增大,针对美学和复杂性的强先验会覆盖确定性简单性,产生“美学偏见”,阻碍模型从数据模拟过渡到真正的抽象推理。为更好地探讨此问题,我们构建了AI顺从性的概念,将其形式化为分层框架,以评估模型从概率近似过渡到像素级确定性的能力(等级1至5)。我们引入Violin——首个系统化基准,旨在评估第4级顺从性,通过三个确定性任务:色彩纯度、图像掩码和几何形状生成。使用Violin,我们评估了多种最新模型,发现闭源模型在确定性精度上通常优于开源模型。有趣的是,我们基准上的表现与自然图像生成基准呈现相关性。我们的工作提供了实现人类指令与模型输出之间更好对齐的基础框架和工具。
引用
@article{arxiv.2603.00166,
title = {Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?},
author = {Hongyu Li and Kuan Liu and Yuan Chen and Juntao Hu and Huimin Lu and Guanjie Chen and Xue Liu and Guangming Lu and Hong Huang},
journal= {arXiv preprint arXiv:2603.00166},
year = {2026}
}