中文

用于时空热力图的对抗精炼 VQ-GAN 与密集运动标记化

计算机视觉与模式识别 2025-09-24 v1 人工智能

摘要

由于高维性和固有的冗余性,连续的人类运动理解仍然是计算机视觉中的核心挑战。高效压缩和表示对于分析复杂的运动动力学至关重要。在这项工作中,我们引入了一种带有密集运动标记化的对抗精炼 VQ-GAN 框架,用于压缩时空热力图,同时保留人类运动的细粒度轨迹。我们的方法将密集运动标记化与对抗精炼相结合,消除了在非对抗基线中观察到的运动模糊和时间错位等重建伪影。我们在 CMU Panoptic 数据集上的实验提供了我们方法优越性的确凿证据,在 SSIM 上比 dVAE 基线高出 9.31%,并将时间不稳定性降低了 37.1%。此外,我们的密集标记化策略实现了对运动复杂性的新分析,揭示了 2D 运动可以用紧凑的 128 个 token 的词表最优表示,而 3D 运动的复杂性则需要大得多的 1024 个 token 的码本才能忠实重建。这些结果确立了在多种运动分析应用中的实际部署可行性。本工作的代码库可在 https://github.com/TeCSAR-UNCC/Pose-Quantization 获取。

关键词

引用

@article{arxiv.2509.19252,
  title  = {Adversarially-Refined VQ-GAN with Dense Motion Tokenization for Spatio-Temporal Heatmaps},
  author = {Gabriel Maldonado and Narges Rashvand and Armin Danesh Pazho and Ghazal Alinezhad Noghre and Vinit Katariya and Hamed Tabkhi},
  journal= {arXiv preprint arXiv:2509.19252},
  year   = {2025}
}