基于几何条件的扩散模型用于遮挡鲁棒的卧床姿态估计
计算机视觉与模式识别
2026-04-28 v1
摘要
在被毯子遮挡的情况下鲁棒的卧床人体姿态估计仍具有挑战性,因为严重遮挡姿态的可靠标注训练数据稀缺。现有方法依赖多模态感知或图像到图像翻译框架,仅以可见源图像为条件,限制了可扩展性和姿态多样性。本文将遮挡感知数据增强重新表述为几何条件生成建模任务。我们系统比较了确定性遮挡、非配对翻译、配对扩散基翻译以及提出的姿态条件 Latent 扩散模型(Pose-LDM)。不同于图像引导的方法,Pose-LDM 可直接从骨架关键点合成被毯子覆盖的图像,消除对配对监督和像素级源图像条件的依赖,同时支持来自任意姿态输入的生成。所有数据增强策略均通过固定主干网络影响下游姿态估计进行评估。Pose-LDM 在严重遮挡下实现最高的严格定位精度,同时保持整体检测性能与配对扩散模型相当,接近完全监督训练的性能。这些结果表明,几何条件扩散为无需修改感知管道即可实现遮挡鲁棒的卧床姿态估计提供了有效且监督效率高的途径。代码已公开于 github.com/navidTerraNova/GeoDiffPose。
引用
@article{arxiv.2604.23651,
title = {Geometry-Conditioned Diffusion for Occlusion-Robust In-Bed Pose Estimation},
author = {Navid Aslankhani Khameneh and Marco Carletti and Cigdem Beyan},
journal= {arXiv preprint arXiv:2604.23651},
year = {2026}
}
备注
This is the preprint version of the paper. The final version has been accepted for publication in the Proceedings of the 20th IEEE International Conference on Automatic Face and Gesture Recognition (IEEE FG 2026)