SAGI:语义对齐与不确定性引导的AI图像填充
计算机视觉与模式识别
2025-08-05 v3
摘要
近期生成式AI的进展使以文本为导向的图像填充——通过文本提示添加、删除或更改图像区域——变得广为人知。然而,生成语义正确的照片逼真图像通常需要精心设计的提示,并通过评估生成内容的真实性进行迭代细化——这些任务通常由人类执行。为自动化生成过程,我们提出语义对齐与不确定性引导的AI图像填充(SAGI),一种模型无关的管道,从分布中采样提示以接近人类感知,并评估生成内容并丢弃偏离此分布的实例,我们通过使用预训练的大型语言模型和视觉语言模型来近似这些分布。通过在多个最先进的填充模型上应用此管道,我们创建了SAGI数据集(SAGI-D),目前是最大且最具多样性的AI生成填充图像数据集,包含超过9.5万个填充图像及其人类评估的子集。我们的实验表明,语义对齐显著提高图像质量和美学,而不确定性引导有效识别真实的操纵——在应用我们的管道后,人类区分填充图像与真实图像的准确率从74%降至35%。此外,使用SAGI-D训练多个图像取证方法,可在平均IoU上实现37.4%的样本内检测性能提升和26.1%的样本外泛化提升,同样证明了其在对抗生成式AI的恶意滥用方面的实用性。代码和数据集可在 https://mever-team.github.io/SAGI/ 获取。
引用
@article{arxiv.2502.06593,
title = {SAGI: Semantically Aligned and Uncertainty Guided AI Image Inpainting},
author = {Paschalis Giakoumoglou and Dimitrios Karageorgiou and Symeon Papadopoulos and Panagiotis C. Petrantonakis},
journal= {arXiv preprint arXiv:2502.06593},
year = {2025}
}
备注
ICCV2025