结合 LLM 增强提示与多源监督的知识感知文物图像合成
计算机视觉与模式识别
2023-12-14 v1 人工智能
摘要
古代文物是文化保存与修复的重要媒介。然而,许多文物实体已经受损或遗失,在考古学与历史研究中留下了空白,这呼唤着文物图像生成技术。尽管开放域文本到图像合成取得了显著进展,但现有方法未能捕捉文本描述中呈现的重要领域知识,导致重建图像出现形状和图案等错误。在本文中,我们提出了一种新颖的知识感知文物图像合成方法,能将遗失的历史物体准确地转化为其视觉形态。我们使用预训练扩散模型作为骨干网络,并引入三项关键技术来增强文本到图像生成框架:1)我们利用从大型语言模型(LLMs)中提取的显式考古知识构建提示;2)我们以对比方式将额外的文本指导融入相关的历史专业知识;3)我们在边缘和感知特征上引入进一步的视觉语义约束,使我们的模型能够学习文物更复杂的视觉细节。与现有方法相比,我们提出的模型生成了更高质量的文物图像,与文献中包含的隐含细节和历史知识更为契合,从而在自动评估指标和人类评估中均取得了显著提升。我们的代码和数据可在 https://github.com/danielwusg/artifact_diffusion 获取。
引用
@article{arxiv.2312.08056,
title = {Knowledge-Aware Artifact Image Synthesis with LLM-Enhanced Prompting and Multi-Source Supervision},
author = {Shengguang Wu and Zhenglun Chen and Qi Su},
journal= {arXiv preprint arXiv:2312.08056},
year = {2023}
}