面向视觉艺术家创作的大型文本到图像生成模型
人机交互
2023-02-17 v3
摘要
大型文本到图像生成模型(LTGMs)(如 DALL-E)是在海量数据集上训练的自监督深度学习模型,已展现出从多模态输入生成高质量开放域图像的能力。尽管它们甚至能生成物体的拟人化版本、以合理方式组合不相关概念,并对任何用户提供的图像进行变体创作,我们仍观察到此类快速的技术进步令许多视觉艺术家在更主动地将 LTGMs 用于其创作时感到迷失。本工作的目标是理解视觉艺术家如何采用 LTGMs 来辅助其创作。为此,我们开展了访谈研究,并对 72 篇系统/应用论文进行了系统的文献综述以深入考察。涵盖 35 个不同视觉艺术领域的共 28 位视觉艺术家认可了 LTGMs 在支持创作中的多功能性与高可用性:自动化创作过程(即自动化)、拓展创意(即探索)以及促进或仲裁交流(即中介)。最后我们给出了四条设计准则,供未来研究者在使用 LTGMs 构建智能用户界面时参考。
引用
@article{arxiv.2210.08477,
title = {Large-scale Text-to-Image Generation Models for Visual Artists' Creative Works},
author = {Hyung-Kwon Ko and Gwanmo Park and Hyeon Jeon and Jaemin Jo and Juho Kim and Jinwook Seo},
journal= {arXiv preprint arXiv:2210.08477},
year = {2023}
}
备注
15 pages, 3 figures