基于多任务基准的文本到图像模型人工评估
计算机视觉与模式识别
2022-11-23 v1 人工智能
机器学习
摘要
我们提供了一种用于评估文本到图像模型的新多任务基准。我们进行了人工评估,比较了最常见的开源(Stable Diffusion)和商业(DALL-E 2)模型。二十名计算机科学人工智能研究生在三个任务、三个难度级别上,对每个模型的十个提示进行了评估,提供了3600个评分。文本到图像生成已取得快速进展,许多近期模型已展示出为各种提示创建逼真高分辨率图像的能力。然而,当前的文本到图像方法以及更广泛的视觉-语言理解研究仍难以处理包含许多具有多重属性和关系的对象的复杂文本提示。我们引入了一个新的文本到图像基准,包含跨越多个应用的32个任务套件,以捕捉模型处理文本提示不同特征的能力。例如,要求模型生成数量可变的同一对象以衡量其计数能力,或提供每个对象具有不同属性的文本提示以识别其正确匹配对象与属性的能力。我们的新多任务基准由三个难度级别(简单、中等和困难)的挑战任务以及对每张生成图像的人工评分组成,而非在一组提示上主观评估文本到图像结果。
引用
@article{arxiv.2211.12112,
title = {Human Evaluation of Text-to-Image Models on a Multi-Task Benchmark},
author = {Vitali Petsiuk and Alexander E. Siemenn and Saisamrit Surbehera and Zad Chin and Keith Tyser and Gregory Hunter and Arvind Raghavan and Yann Hicke and Bryan A. Plummer and Ori Kerret and Tonio Buonassisi and Kate Saenko and Armando Solar-Lezama and Iddo Drori},
journal= {arXiv preprint arXiv:2211.12112},
year = {2022}
}
备注
NeurIPS 2022 Workshop on Human Evaluation of Generative Models (HEGM)