中文

SSD-Poser:基于稀疏观测的面部姿态估计方法——状态空间二元性

计算机视觉与模式识别 2025-04-28 v1 人机交互

摘要

AR/VR 的日益增长的应用需求推动了从头戴式显示器(HMDs)进行全身姿态估计的实时需求。尽管 HMDs 提供头部和手部的关节信号,但从受限下半身约束条件重建全身姿态仍具有挑战性。最近的进展常常依赖传统神经网络和生成模型以提升此任务性能,例如 Transformer 和扩散模型。然而,这些方法在实现精确姿态重建与保持快速推理速度之间难以取得平衡。为克服这些挑战,本文设计了一种轻量且高效的模型 SSD-Poser,用于从稀疏观测进行稳健的全身运动估计。SSD-Poser 融合精心设计的混合编码器——状态空间注意力编码器(State Space Attention Encoders),以适应复杂运动姿态并实现实时逼真的姿态重建。此外,引入频率感知解码器(Frequency-Aware Decoder),以减轻由可变频率运动信号引起的抖动,显著提升运动平滑度。针对 AMASS 数据集上的全面实验表明,SSD-Poser 在准确率和计算效率方面均表现出色,推理效率在最新方法中表现突出。

关键词

引用

@article{arxiv.2504.18332,
  title  = {SSD-Poser: Avatar Pose Estimation with State Space Duality from Sparse Observations},
  author = {Shuting Zhao and Linxin Bai and Liangjing Shao and Ye Zhang and Xinrong Chen},
  journal= {arXiv preprint arXiv:2504.18332},
  year   = {2025}
}

备注

9 pages, 6 figures, conference ICMR 2025