Adept:基于离散余弦变换图和关键点的人类中心预训练标注去噪辅助任务
计算机视觉与模式识别
2025-04-30 v1
摘要
人类中心感知是众多计算机视觉任务的核心,长期以来一直是研究焦点。然而,之前的研究将这些人类中心任务分别进行研究,其性能受限于公共任务特定数据集的规模。最近的人类中心方法利用深度等额外模态信息来学习细粒度语义信息,但由于对摄像机视角敏感且互联网上RGB-D数据稀缺,这些方法在预训练模型中受益受限。本文通过放弃深度信息,探索离散余弦变换(DCT)中RGB图像的语义信息,以提高人类中心预训练方法的数据可扩展性。我们进一步提出新的基于关键点和DCT图的标注去噪辅助任务,以强制RGB图像提取器学习人类身体的细粒度语义信息。我们的实验表明,在无深度标注的情况下使用大规模数据集(COCO和AIC数据集)进行预训练, our 模型在姿态估计方面在COCO上提升0.5 mAP,在MPII上提升1.4 PCKh,在Human3.6M上下降0.51 EPE;在人体解析方面在Human3.6M上提升4.50 mIoU;在人群计数方面在SHA上下降3.14 MAE,在SHB上下降0.07 MAE;在人群定位方面在SHA上提升1.1 F1分数;在人体重识别方面在Market1501上提升0.1 mAP,在MSMT上提升0.8 mAP。我们还在MPII+NTURGBD数据集上验证了我们方法的有效性。
引用
@article{arxiv.2504.20800,
title = {Adept: Annotation-Denoising Auxiliary Tasks with Discrete Cosine Transform Map and Keypoint for Human-Centric Pretraining},
author = {Weizhen He and Yunfeng Yan and Shixiang Tang and Yiheng Deng and Yangyang Zhong and Pengxin Luo and Donglian Qi},
journal= {arXiv preprint arXiv:2504.20800},
year = {2025}
}