See and Fix the Flaws: 通过 Agentic 数据合成使 VLMs 和扩散模型理解视觉瑕疵
计算机视觉与模式识别
2026-03-27 v2 人工智能
摘要
尽管近期在扩散模型方面取得了进展,AI 生成的图像仍常常包含妨碍真实感的视觉瑕疵。虽然更彻底的预训练和更大模型可能减少瑕疵,但无法确保它们能完全消除,这使得瑕疵缓解成为一个至关重要的研究领域。以往的瑕疵感知方法依赖人工标注的瑕疵数据集,这些数据集成本高昂且难以规模化,凸显了需要自动化方法可靠获取带瑕疵标注数据集的需求。本文提出了 ArtiAgent,通过高效创建真实图像与瑕疵注入图像的配对图像。ArtiAgent 包含三个代理:感知代理从真实图像中识别并定位实体和子实体;合成代理通过创新的 patch-wise 嵌入操作在扩散变换器中引入瑕疵;筛选代理过滤合成的瑕疵并为每个实例生成局部和全局解释。使用 ArtiAgent,我们合成了 10 万张带丰富瑕疵标注的图像,并在多样化的应用中展示了其有效性和多样性。代码已提供。
引用
@article{arxiv.2602.20951,
title = {See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis},
author = {Jaehyun Park and Minyoung Ahn and Minkyu Kim and Jonghyun Lee and Jae-Gil Lee and Dongmin Park},
journal= {arXiv preprint arXiv:2602.20951},
year = {2026}
}