文本到图像生成中的默认图像探索
人机交互
2026-01-27 v6 人工智能
摘要
在文本到图像(TTI)生成的创意实践中,图像是从文本提示合成的。按照设计,TTI模型总是会产生输出,即使提示包含未知术语。在这种情况下,模型可能会生成默认图像:这些图像在许多无关提示下彼此接近。研究默认图像对于设计更好的提示工程和TGI生成方法具有重要价值。我们首次针对Midjourney进行默认图像的调查。我们描述了初始研究,其中手动创建输入提示触发默认图像,以及几个消融研究。基于这些,我们对超过75万张图像进行计算分析,揭示了在无关提示之间存在一致的默认图像。我们还进行了在线用户研究,探讨默认图像如何影响用户满意度。我们的工作为理解TGI生成中的默认图像奠定了基础,突出了其实际相关性以及挑战和未来研究方向。
关键词
引用
@article{arxiv.2505.09166,
title = {An Exploration of Default Images in Text-to-Image Generation},
author = {Hannu Simonen and Atte Kiviniemi and Hannah Johnston and Helena Barranha and Jonas Oppenlaender},
journal= {arXiv preprint arXiv:2505.09166},
year = {2026}
}
备注
21 pages, 10 figures