VisualCloze:基于视觉上下文学习的通用图像生成框架
计算机视觉与模式识别
2026-01-08 v4
摘要
扩散模型的最新进展显著推动了各种图像生成任务的发展。然而,当前的主流方法仍集中于构建特定任务模型,这在支持广泛不同需求时效率有限。虽然通用模型试图解决这一局限性,但它们面临着关键挑战,包括可泛化的任务指令、合适的任务分布和统一的架构设计。为了应对这些挑战,我们提出了 VisualCloze,一种通用图像生成框架,它支持广泛的领域内任务、对未见任务的泛化、对多个任务的未见统一以及逆向生成。与依赖基于语言的任务指令的现有方法不同(这会导致任务歧义和泛化能力弱),我们集成了视觉上下文学习,允许模型从视觉演示中识别任务。同时,视觉任务分布固有的稀疏性阻碍了跨任务可迁移知识的学习。为此,我们引入了 Graph200K,一个建立各种相互关联任务的图结构数据集,以增强任务密度和可迁移知识。此外,我们发现我们统一的图像生成公式与图像补全共享一致的目标,使我们能够利用预训练补全模型的强大生成先验,而无需修改架构。
引用
@article{arxiv.2504.07960,
title = {VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning},
author = {Zhong-Yu Li and Ruoyi Du and Juncheng Yan and Le Zhuo and Qilong Wu and Zhen Li and Peng Gao and Zhanyu Ma and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2504.07960},
year = {2026}
}
备注
Accepted at ICCV 2025. Project page: https://visualcloze.github.io