中文

ArtWhisperer:一个刻画艺术创作中人机交互的数据集

人工智能 2024-06-18 v4 计算机视觉与模式识别 人机交互 机器学习

摘要

随着生成式 AI 的普及,研究人类用户如何与此类模型交互变得十分重要。在本工作中,我们探究人们如何使用文本到图像模型生成期望的目标图像。为研究该交互,我们创建了 ArtWhisperer,一个在线游戏,其中用户被给定一张目标图像,并需迭代地寻找能生成与该目标外观相似图像的提示词。通过该游戏,我们记录了超过 50,000 次人机交互;每次交互对应一个用户创建的文本提示词及相应的生成图像。其中大多数是重复交互,即用户为找到其目标图像的最佳提示词而迭代,这使其成为研究人机协作的独特序列数据集。在该数据集的初步分析中,我们识别出提示词交互与用户策略的若干特征。人们提交多样化的提示词,并能发现可生成相似图像的多种文本描述。有趣的是,随着用户找到更好的提示词,提示词多样性并未降低。我们进一步提出一种利用该数据集量化 AI 可操控性的新指标。我们将可操控性定义为完成任务所需的预期交互次数。我们通过为每个目标任务拟合马尔可夫链并计算马尔可夫链中达到足够得分的预期时间来进行估计。我们量化并比较了不同类型目标图像及两种不同模型下的 AI 可操控性,发现城市图像和自然世界图像比艺术与幻想图像更具可操控性。这些发现为人机交互行为提供了见解,给出了评估 AI 可操控性的具体方法,并展示了 ArtWhisperer 数据集的通用效用。

关键词

引用

@article{arxiv.2306.08141,
  title  = {ArtWhisperer: A Dataset for Characterizing Human-AI Interactions in Artistic Creations},
  author = {Kailas Vodrahalli and James Zou},
  journal= {arXiv preprint arXiv:2306.08141},
  year   = {2024}
}

备注

31 pages, 27 figures, ICML 2024