骨架姿态轨迹的弹性形状变分自编码器
计算机视觉与模式识别
2026-05-18 v3 机器学习
摘要
深度生成模型为建模图像、视频、3D 对象和文本等复杂结构数据提供了灵活框架。然而,对于人类骨架序列,标准变分自编码器(VAE)常在捕获骨架形状及其运动内在几何方面,而非针对性地分配大量容量给诸如相机姿态、主体规模、视点和执行速度等 nuisance 因素。我们提出弹性形状-变分自编码器(ES-VAE),一种针对骨架轨迹的几何感知生成模型,利用 transported square-root velocity field(TSRVF)表示在 Kendall 的形状流形上实现。该表示天然消除形状的刚性平移、旋转和全局缩放,以及序列的时间速率变异,隔离潜在的形状动力学。ES-VAE 编码器将骨架序列映射到低维潜在空间,包含黎曼对数图;解码器则使用相应的指数图进行序列重构。在两个数据集上验证了 ES-VAE 的有效性。首先,我们分析骨架步态循环以预测临床运动评分并将受试者分类为健康或中风后患者。其次,我们在 NTU RGB+D 数据集上评估动作识别。在两种情况下,ES-VAE 在标准 VAE 和多种序列建模基线(包括时序卷积网络、transformer 和图卷积网络)方面均表现出色。更广泛地说,ES-VAE 为在姿态形状流形上学习长期数据生成模型提供了原则框架,相较于现有深度学习方法在潜在表示和下游性能方面均有所改进。
引用
@article{arxiv.2605.09231,
title = {An Elastic Shape Variational Autoencoder for Skeleton Pose Trajectories},
author = {Arafat Rahman and Shashwat Kumar and Laura E. Barnes and Anuj Srivastava},
journal= {arXiv preprint arXiv:2605.09231},
year = {2026}
}
备注
9 pages