海市蜃楼中的建筑:在建筑风格、元素与类型上评估生成式图像模型
计算机视觉与模式识别
2026-01-15 v1 计算机与社会
摘要
生成式人工智能(GenAI)文本到图像系统日益被用于生成建筑图像,但其在受历史规则约束的领域内再现准确图像的能力仍不甚明了。我们使用涵盖风格、类型和编码元素的 30 个建筑提示词,评估了五个广泛使用的 GenAI 图像平台(Adobe Firefly、DALL-E 3、Google Imagen 3、Microsoft Image Generator 和 Midjourney)。每个提示词-生成器对生成四张图像(共 600 张图像)。两位建筑历史学家根据预定义标准独立对每张图像的准确性进行评分,并通过共识解决分歧。集合级别的性能以每四张图像集合中零到四张准确图像来汇总。常见提示词生成的图像比罕见提示词的准确度高 2.7 倍(p < 0.05)。在各平台中,总体准确度有限(最高准确率得分 52%;最低 32%;平均 42%)。全对(4/4)结果在各平台间相似。相比之下,全错(0/4)结果差异显著,其中 Imagen 3 失败最少,而 Microsoft Image Generator 失败最多。对图像数据集的定性审查发现了反复出现的模式,包括过度装饰、中世纪风格与其后世复兴之间的混淆,以及对描述性提示词的误表示(例如,卵锚饰、束柱、帆拱)。这些发现支持了对 GenAI 合成内容进行可见标注、为未来训练数据集建立溯源标准,以及在教育中谨慎使用 GenAI 建筑图像的必要性。
引用
@article{arxiv.2601.09169,
title = {Architecture inside the mirage: evaluating generative image models on architectural style, elements, and typologies},
author = {Jamie Magrill and Leah Gornstein and Sandra Seekins and Barry Magrill},
journal= {arXiv preprint arXiv:2601.09169},
year = {2026}
}
备注
24 pages, 7 figures