中文

DiffusionWorldViewer:揭示并拓展生成式文本到图像模型所反映的世界观

机器学习 2024-02-06 v2 人工智能 计算机视觉与模式识别 计算机与社会

摘要

生成式文本到图像(TTI)模型能从简短的文本描述生成高质量图像,并被广泛应用于学术与创意领域。如同人类,TTI 模型拥有一种世界观,即从训练数据和任务中学到的关于世界的认知,它会影响模型对给定提示所生成的图像。然而,TTI 模型的世界观通常对用户隐藏,导致用户难以建立对 TTI 输出的直觉,且常与用户世界观不一致,从而产生不符合用户预期的输出图像。为此,我们引入了 DiffusionWorldViewer,这是一个交互式界面,可揭示 TTI 模型在输出人口统计维度上的世界观,并提供编辑工具以将输出图像与用户视角对齐。在一项有 18 名不同 TTI 用户参与的的用户研究中,我们发现 DiffusionWorldViewer 能帮助用户在生成图像中表达其多样化观点,并挑战当前 TTI 模型中所反映的有限世界观。

关键词

引用

@article{arxiv.2309.09944,
  title  = {DiffusionWorldViewer: Exposing and Broadening the Worldview Reflected by Generative Text-to-Image Models},
  author = {Zoe De Simone and Angie Boggust and Arvind Satyanarayan and Ashia Wilson},
  journal= {arXiv preprint arXiv:2309.09944},
  year   = {2024}
}

备注

20 pages, 8 figures