基于分析-综合的广义姿态空间嵌入用于野外训练
计算机视觉与模式识别
2024-11-14 v1 人机交互
摘要
现代姿态估计模型在大规模人工标注数据集上训练,成本高昂且可能无法覆盖真实世界中人体姿态和外观的全貌。随着神经渲染的进步,分析-综合框架——不仅能预测姿态,还能渲染姿态——成为一种极具吸引力的范式,有望缓解大规模人工标注的需求。尽管近期工作已证明该方法的可行性,但由于中间骨架表示过于简化,预测结果存在大量翻转,导致精度低下,并阻碍了三维定位等下游知识的获取。我们提出一种更具表达力的中间骨架表示,能够捕捉姿态的语义(左右),从而显著减少翻转。为成功训练这一新表示,我们利用基于合成数据的训练协议扩展了分析-综合框架。实验表明,我们的表示减少了翻转并提高了预测精度。在标准基准上,我们的方法优于基于分析-综合训练的先前模型。
引用
@article{arxiv.2411.08603,
title = {Generalized Pose Space Embeddings for Training In-the-Wild using Anaylis-by-Synthesis},
author = {Dominik Borer and Jakob Buhmann and Martin Guay},
journal= {arXiv preprint arXiv:2411.08603},
year = {2024}
}