中文

迈向一致的长时姿态生成

计算机视觉与模式识别 2025-07-25 v1

摘要

当前的姿态生成方法严重依赖中间表示,要么通过带有量化的两阶段流水线,要么通过推理过程中累积误差的自回归模型。这一根本性限制导致性能下降,尤其是在需要保持时间一致性的长时姿态生成中。我们提出了一种新颖的单阶段架构,该架构在连续坐标空间中,仅凭极少的上下文(单张RGB图像和文本描述)直接生成姿态,同时保持训练和推理之间的一致性分布。我们的关键创新在于,通过一个保持空间关系的相对运动预测机制,以及一个统一的占位符标记方法,直接在姿态坐标上操作,从而消除了对中间表示或基于标记的生成的需求,该方法能够在训练和推理时以相同的行为进行单次前向生成。通过在Penn Action和First-Person Hand Action Benchmark (F-PHAB)数据集上的大量实验,我们证明了我们的方法显著优于现有的基于量化和自回归的方法,尤其是在长时生成场景中。

关键词

引用

@article{arxiv.2507.18382,
  title  = {Towards Consistent Long-Term Pose Generation},
  author = {Yayuan Li and Filippos Bellos and Jason Corso},
  journal= {arXiv preprint arXiv:2507.18382},
  year   = {2025}
}

备注

10 pages, 5 figures, 4 tables