中文

面向轻量级人体中心视觉模型的动态模式对齐预训练学习

计算机视觉与模式识别 2025-08-12 v1

摘要

人体中心视觉模型(HVM)由于在大规模人物图像上进行大规模预训练,已实现显著的泛化能力。然而,这些模型对大型神经网络结构和预训练数据可访问性的依赖,显著限制了其在实际应用中的实用性。为解决这一局限性,我们提出动态模式对齐学习(DPAL),一种基于知识蒸馏的预训练框架,高效训练轻量级 HVM 以获得强大的泛化能力。具体而言,人体中心视觉感知高度依赖三种典型视觉模式,包括全局身份模式、局部形状模式和多人交互模式。为实现可泛化的轻量级 HVM,我们首先设计一种动态模式解码器(D-PaDe),作为动态混合专家(MoE)模型。它包含三个专门的专家,根据输入图像和模式查询自适应提取典型视觉模式。随后,我们提出三级对齐目标,旨在最小化轻量级 HVM 与大型 HVM 在全局图像层级、局部像素层级和实例关系层级之间的泛化差距。通过这两个刻意设计,DPAL 有效指导轻量级模型从大型 HVM 中学习所有典型的人体视觉模式,从而实现对各种人体中心视觉任务的泛化。广泛的在 15 个具有挑战性数据集上的实验表明,DPAL 的有效性令人瞩目。值得注意的是,当采用 PATH-B 作为教师时,DPAL-ViT/Ti(500 万参数)的泛化能力与现有大型 HVM 如 PATH-B(8400 万参数)和 Sapiens-L(3.07 亿参数)相当,并大幅优于包括 Proteus-ViT/Ti(500 万参数)和 TinyMiM-ViT/Ti(500 万参数)在内的以往蒸馈预训练方法。

关键词

引用

@article{arxiv.2508.07144,
  title  = {Dynamic Pattern Alignment Learning for Pretraining Lightweight Human-Centric Vision Models},
  author = {Xuanhan Wang and Huimin Deng and Ke Liu and Jun Wang and Lianli Gao and Jingkuan Song},
  journal= {arXiv preprint arXiv:2508.07144},
  year   = {2025}
}