AtelierEval:用于评估人类与大语言模型作为文本到图像提示工程师的代理
人工智能
2026-05-22 v1
摘要
文本到图像(T2I)系统日益依赖上游提示工程师,无论是人类还是多模态大语言模型(MLLM),将用户意图转化为详细提示。然而,当前基准固定提示仅评估 T2I 模型,完全未衡量上游组件的提示熟练度。我们引入 AtelierEval,这是第一个统一的基准,衡量跨 360 个专家精心设计任务的提示熟练度。基于认知视角,它涵盖三个任务类别,并通过真实世界挑战的分类法来实例化任务,提供面向人类和 MLLM 的双重界面。为实现可扩展且可靠的评估,我们提出了 AtelierJudge,这是一种基于技能的、具有记忆增强的代理评估器。它为提示-图像对产生主观与客观分数,与人类专家的 Spearman 相关系数达 0.79,接近人类水平。广泛实验基准测试 8 个 MLLM 对 48 名人类用户下的 4 个 T2I 后端,验证了 AtelierEval 作为稳健诊断工具的有效性,并揭示了模仿优于规划的优势,主张未来提示工程师采用图像增强方向。我们的工作已公开,以支持未来研究。
引用
@article{arxiv.2605.22645,
title = {AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters},
author = {Hanjun Luo and Zhimu Huang and Sylvia Chung and Yiran Wang and Yingbin Jin and Jialin Li and Jiang Li and Xinfeng Li and Hanan Salam},
journal= {arXiv preprint arXiv:2605.22645},
year = {2026}
}
备注
Accepted by ICML 2026