中文

SynergyAmodal:基于文本控制实现图像无遮挡恢复

计算机视觉与模式识别 2025-04-29 v1

摘要

图像无遮挡恢复(或全景完成)旨在恢复被遮挡实例在图像中不可见区域(即形状和外观)的恢复。在近期进步显著,但稀缺的高质量数据仍是主要障碍,这些数据在多样性、可信度和保真度方面取得平衡。为此,我们确定了三个关键要素:利用野外图像数据实现多样性、纳入人类专家知识实现可信度、利用生成先验实现保真度。我们提出了SynergyAmodal,一种新型框架,用于协同合成野外全景数据集,包含全面的形状和外观标注,通过三部分数据-人类-模型协作集成上述要素。首先,我们设计了一种基于遮挡的自监督学习算法,利用野外图像数据的多样性,将图像修复扩散模型微调为部分完成扩散模型。其次,我们建立了一个协同合成管道,用于迭代过滤、精炼、选择和标注部分完成扩散模型的初始无遮挒结果,通过人类专家指导和先验模型约束确保可信度和保真度。该管道生成约1.6万对的高质量配对全景数据集,涵盖广泛的类别和尺度多样性。最后,我们在合成数据集上训练完整的完成扩散模型,纳入文本提示作为条件信号。大量实验表明,我们框架在实现零样本泛化和文本可控性方面的有效性。我们的代码、数据集和模型将在https://github.com/imlixinyang/SynergyAmodal 上公开。

关键词

引用

@article{arxiv.2504.19506,
  title  = {SynergyAmodal: Deocclude Anything with Text Control},
  author = {Xinyang Li and Chengjie Yi and Jiawei Lai and Mingbao Lin and Yansong Qu and Shengchuan Zhang and Liujuan Cao},
  journal= {arXiv preprint arXiv:2504.19506},
  year   = {2025}
}

备注

17 pages