Diffusion Explainer:面向文本到图像 Stable Diffusion 的可视化解释工具
计算与语言
2024-09-04 v3 人工智能
人机交互
机器学习
摘要
基于扩散的生成模型在创建令人信服的图像方面的出色能力已引起全球关注。然而,其复杂的结构与操作常给非专家理解带来挑战。我们提出 Diffusion Explainer,首个解释 Stable Diffusion 如何将文本提示转换为图像的交互式可视化工具。Diffusion Explainer 将 Stable Diffusion 复杂结构的视觉概览与底层操作的解释紧密集成。通过比较提示变体的图像生成,用户可发现关键词变化对图像生成的影响。一项有 56 名参与者的用户研究表明,Diffusion Explainer 为非专家提供了显著的学习收益。我们的工具已被来自 124 个国家的超过 10,300 名用户使用,网址为 https://poloclub.github.io/diffusion-explainer/。
引用
@article{arxiv.2305.03509,
title = {Diffusion Explainer: Visual Explanation for Text-to-image Stable Diffusion},
author = {Seongmin Lee and Benjamin Hoover and Hendrik Strobelt and Zijie J. Wang and ShengYun Peng and Austin Wright and Kevin Li and Haekyu Park and Haoyang Yang and Duen Horng Chau},
journal= {arXiv preprint arXiv:2305.03509},
year = {2024}
}
备注
5 pages, 7 figures