中文

骨架到图像编码:通过视觉预训练模型实现骨架表示学习

计算机视觉与模式识别 2026-03-09 v1 人工智能

摘要

近期大规模预训练视觉模型在广泛的下游任务中展现出惊人的能力,包括跨模态和多模态场景。然而,其直接应用于 3D 人体骨架数据仍面临数据格式根本差异的挑战。此外,稀缺的大规模骨架数据集以及需将骨架数据纳入多模态动作识别而不引入额外模型分支的需求,构成了显著的研究机会。为此,我们提出骨架到图像编码(Skeleton-to-Image Encoding, S2I),一种将骨架序列通过基于身体部位语义进行分区和排列,再调整至标准图像尺寸的转化方法。该编码首次使强大的视觉预训练模型可用于自监督骨架表示学习,有效地将视觉域的丰富知识传递至骨架分析。虽然现有骨架方法常针对特定单一骨架格式设计模型,但忽视了源自多样数据来源的结构异质性。相比之下,我们的 S2I 表示提供一种统一的图像格式,自然适应异构骨架数据。针对 NTU-60、NTU-120 和 PKU-MMD 上的大量实验表明,我们的方法在自监督骨架表示学习中有效且具通用性,包括在挑战性的跨格式评估设置下。

关键词

引用

@article{arxiv.2603.05963,
  title  = {Skeleton-to-Image Encoding: Enabling Skeleton Representation Learning via Vision-Pretrained Models},
  author = {Siyuan Yang and Jun Liu and Hao Cheng and Chong Wang and Shijian Lu and Hedvig Kjellstrom and Weisi Lin and Alex C. Kot},
  journal= {arXiv preprint arXiv:2603.05963},
  year   = {2026}
}

备注

Submitted to IEEE TPAMI, under review