中文

探索文本到图像生成中提示语言模式及其对视觉多样性的影响

人机交互 2025-04-22 v1 人工智能 计算机与社会

摘要

跟随最初的热潮,文本到图像(TTI)模型如今正在得到更严肃的审视。虽然许多讨论集中在大规模训练数据中嵌入的偏见和刻板印象上,但用户与这些模型交互的社会技术动态仍未得到充分探索。本研究检验了用户在构建提示时所作的语言和语义选择,以及这些选择如何影响生成输出的多样性。我们分析了来自 Civiverse 数据集的超过六百万个提示,该数据集来自 CivitAI 平台,跨越七个月。我们根据用户语言实验的程度将用户分为三组:一致性重复者、偶尔重复者和非重复者。我们的发现表明,随着用户参与度的增加,提示语言通过采用流行的社区标签和描述器而趋于同质化,其中重复提示占提交量的 40-50%。同时,语义相似度和主题偏好保持相对稳定,强调常见主题和表面审美。使用 Vendi 分数量化视觉多样性,我们演示了提示中词汇相似性与生成图像视觉相似性之间存在明确相关性,表明语言重复强化了更少样本的表示。这些发现凸显了用户驱动因素在塑造 AI 生成图像方面的重要作用,超越固有模型偏见,强调需要工具和实践来鼓励 TTI 系统内更广泛的语言和主题实验,以培育更具包容性和多样性的 AI 生成内容。

关键词

引用

@article{arxiv.2504.14125,
  title  = {Exploring Language Patterns of Prompts in Text-to-Image Generation and Their Impact on Visual Diversity},
  author = {Maria-Teresa De Rosa Palmini and Eva Cetinic},
  journal= {arXiv preprint arXiv:2504.14125},
  year   = {2025}
}