面向以人为中心感知的通用多模态预训练
计算机视觉与模式识别
2022-03-28 v1
摘要
以人为中心的感知在视觉与图形学中起着至关重要的作用,但其数据标注成本极其高昂。因此,亟需一个通用预训练模型,作为数据高效下游任务迁移的基础。为此,我们提出了以人为中心的多模态对比学习框架 HCMoCo,其利用人体数据(如 RGB、深度、2D 关键点)的多模态特性进行有效表征学习。该目标面临两个主要挑战:多模态数据的密集预训练,以及稀疏人体先验的高效利用。为应对这些挑战,我们设计了新颖的密集样本内对比学习与稀疏结构感知对比学习目标,通过分层学习具有连续有序特征分布与结构感知语义一致性的模态不变潜在空间。HCMoCo 通过结合异构数据集为不同模态提供预训练,从而实现对现有任务特定人体数据的高效利用。在四种不同模态下游任务上的大量实验证明了 HCMoCo 的有效性,尤其在数据高效设定下(在 DensePose 估计与人体解析上分别提升 7.16% 与 12%)。此外,我们通过探索跨模态监督与缺失模态推理展示了 HCMoCo 的通用性,验证了其强大的跨模态关联与推理能力。
引用
@article{arxiv.2203.13815,
title = {Versatile Multi-Modal Pre-Training for Human-Centric Perception},
author = {Fangzhou Hong and Liang Pan and Zhongang Cai and Ziwei Liu},
journal= {arXiv preprint arXiv:2203.13815},
year = {2022}
}
备注
CVPR 2022; Project Page https://hongfz16.github.io/projects/HCMoCo.html; Codes available at https://github.com/hongfz16/HCMoCo