中文

对象级场景去遮挡

计算机视觉与模式识别 2024-06-13 v1

摘要

在现实场景中,去遮挡物体隐藏部分是一项艰巨的任务。本文提出了一种新的自监督 PArallel visible-to-COmplete diffusion 框架,命名为 PACO,一种用于对象级场景去遮挡的基础模型。利用预训练模型丰富的先验知识,我们首先设计了并行变分自编码器,产生同时编码多个完整对象的全视图特征图;以及可见到完整的潜在生成器,学习从输入图像中不完整对象提取的部分视图特征图和文本提示中隐式预测全视图特征图。为训练 PACO,我们创建了一个包含 50 万样本的大规模数据集,以实现自监督学习,避免对情感遮挡和遮挡区域的繁琐标注。在推理阶段,我们设计了分层去遮挡策略,在保持去遮挡质量的同时提高效率。在 COCOA 和各种现实场景上的大量实验表明,PACO 在场景去遮挡方面的卓越能力,优于当前方法取得了大幅提升。该方法还可扩展到训练集未覆盖的跨域场景和新类别。进一步,我们展示了 PACO 在单视图 3D 场景重建和对象重新组合中的去遮挡应用。

关键词

引用

@article{arxiv.2406.07706,
  title  = {Object-level Scene Deocclusion},
  author = {Zhengzhe Liu and Qing Liu and Chirui Chang and Jianming Zhang and Daniil Pakhomov and Haitian Zheng and Zhe Lin and Daniel Cohen-Or and Chi-Wing Fu},
  journal= {arXiv preprint arXiv:2406.07706},
  year   = {2024}
}

备注

SIGGRAPH 2024. A foundation model for category-agnostic object deocclusion