基于判别-生成协同的遮挡鲁棒性 3D 人体网格恢复
计算机视觉与模式识别
2026-04-24 v1 多媒体
摘要
从单目 RGB 图像恢复 3D 人体网格旨在估计解剖上符合条件的 3D 人体模型,以用于下游应用,但在部分或严重遮挡情况下仍具挑战性。基于回归的方法高效但常在无约束情景下产生不合理或不准确的结果,而基于扩散的方法则为被遮挡区域提供强大的生成先验,但可能因过度依赖生成而削弱对稀有姿态的忠实度。为此,我们提出一种受大脑启发的协同框架,将视觉 Transformer 的判别能力与条件扩散模型的生成能力相结合。具体而言,基于 ViT 的路径从可见区域提取确定性视觉线索,而基于扩散的路径综合结构连贯的人体表示。为有效桥接两条路径,我们设计了多样性一致特征学习模块以对齐判别特征与生成先验,并提出跨注意力多层融合机制以实现语义层次之间的双向交互。实验在标准基准数据集上表明,我们的方法在关键指标上实现了优异性能,并在复杂真实场景中展现出强大的鲁棒性。
引用
@article{arxiv.2604.21712,
title = {Discriminative-Generative Synergy for Occlusion Robust 3D Human Mesh Recovery},
author = {Yang Liu and Zhiyong Zhang},
journal= {arXiv preprint arXiv:2604.21712},
year = {2026}
}