中文

ChatGPT4o / DALL-E3 文生图可视化中的提示保真度

计算机视觉与模式识别 2025-10-28 v1 人工智能

摘要

本研究通过分析自动生成的提示中明确指定的属性是否在生成的图像中得到正确渲染,考察了ChatGPT4o / DALL-E3文生图可视化的提示保真度。利用两个公共领域数据集——包含200张文化创意产业女性工作者可视化图像和230张博物馆策展人可视化图像——本研究评估了个人属性(年龄、头发)、外貌(着装、眼镜)和随身物品(姓名标签、写字板)的准确性。虽然大多数情况下正确渲染,但DALL-E3在所有属性(n=710)中有15.6%偏离了提示规范。随身物品的错误率最低,个人外貌的错误率中等,而对人物本身的描绘错误率最高,尤其是年龄。这些发现揭示了可测量的提示到图像保真度差距,对偏差检测和模型评估具有启示意义。

关键词

引用

@article{arxiv.2510.21821,
  title  = {Prompt fidelity of ChatGPT4o / Dall-E3 text-to-image visualisations},
  author = {Dirk HR Spennemann},
  journal= {arXiv preprint arXiv:2510.21821},
  year   = {2025}
}