深度引导的自监督人体关键点检测:基于跨模态蒸馏
计算机视觉与模式识别
2025-08-14 v2 人工智能
摘要
现有的无监督关键点检测方法对图像施加人工变形,例如遮蔽图像的大部分区域,并使用原始图像的重建作为学习目标来检测关键点。然而,这种方法缺乏图像中的深度信息,并且常常在背景上检测关键点。为了解决这个问题,我们提出了Distill-DKP,一种新颖的跨模态知识蒸馏框架,在自监督设置中利用深度图和RGB图像进行关键点检测。在训练期间,Distill-DKP从基于深度的教师模型中提取嵌入级知识,以指导基于图像的学生模型,推理仅限于学生模型。实验表明,Distill-DKP显著优于之前的无监督方法,在Human3.6M上将平均L2误差降低了47.15%,在Taichi上将平均绝对误差降低了5.67%,在DeepFashion数据集上将关键点精度提高了1.3%。详细的消融研究证明了知识蒸馏在网络不同层上的敏感性。项目页面:https://23wm13.github.io/distill-dkp/
引用
@article{arxiv.2410.14700,
title = {Depth-Guided Self-Supervised Human Keypoint Detection via Cross-Modal Distillation},
author = {Aman Anand and Elyas Rashno and Amir Eskandari and Farhana Zulkernine},
journal= {arXiv preprint arXiv:2410.14700},
year = {2025}
}