Civiverse:用于分析开源文本到图像模型用户参与度的数据集
人机交互
2024-08-29 v1 人工智能
计算机视觉与模式识别
信息检索
摘要
文本到图像(TTI)系统,特别是利用开源框架的系统,在AI生成视觉内容的生产中日益普及。虽然现有文献探索了TTI技术的各种问题,如生成内容中的偏见、知识产权 concerns以及对有害刻板印象的强化,但开源TTI框架尚未从文化视角进行系统性考察。本研究通过分析CivitAI平台——领先的专为TTI AI平台——来弥补这一空白。我们介绍了Civiverse prompt数据集,涵盖数百万图片及相关元数据。我们聚焦于prompt分析,具体考察文本prompt的语义特征,因为这对于解决生成技术相关的社会问题至关重要。该分析提供了关于用户意图、偏好和行为的见解,从而塑造了这些模型的输出。我们的发现显示,用户偏好生成包含色情内容,同时关注语义内容的同质化。这些见解凸显了进一步研究在这些模型中持续偏见、有害刻板印象以及视觉文化均质化的必要性。
引用
@article{arxiv.2408.15261,
title = {Civiverse: A Dataset for Analyzing User Engagement with Open-Source Text-to-Image Models},
author = {Maria-Teresa De Rosa Palmini and Laura Wagner and Eva Cetinic},
journal= {arXiv preprint arXiv:2408.15261},
year = {2024}
}