基于稳定扩散的人类去遮挡方法
计算机视觉与模式识别
2025-08-19 v1
摘要
人类可以凭借先验知识和可见线索推断被遮挡物体缺失部分。然而,使深度学习模型准确预测此类遮挡区域仍然是一个具有挑战性的任务。去遮挡技术旨在重建遮挡区域的mask和RGB外观。在本工作中,我们聚焦于人类去遮挡,具体目标是恢复被遮挡的身体结构和外观。我们的做法将任务分解为两个阶段:mask完成和RGB完成。第一个阶段利用基于扩散的人类身体先验,提供身体结构的全面表示,结合遮挡关节热图,提供关于缺失区域的显式空间线索。重建的无遮挡mask随后作为第二个阶段的条件输入,以指导模型重建哪些区域。为进一步增强RGB生成,我们整合了来自视觉问答(VQA)模型派生的人类特定文本特征,通过CLIP编码器进行编码。RGB完成使用稳定扩散实现,对解码器进行微调以缓解可见区域像素级退化——这是已有基于扩散的去遮挡方法的一个已知局限性,由潜在空间变换引起。我们的方法能够在严重遮挡下有效重建人类外观,在mask和RGB完成方面 consistently 优于现有方法。此外,我们的方法生成的去遮挡图像可提高下游人类相关任务的性能,如2D姿态估计和3D人体重建。代码将公开发布。
引用
@article{arxiv.2508.12663,
title = {Stable Diffusion-Based Approach for Human De-Occlusion},
author = {Seung Young Noh and Ju Yong Chang},
journal= {arXiv preprint arXiv:2508.12663},
year = {2025}
}
备注
MM 2025