EgoPoseFormer v2:面向 AR/VR 的精准以太人体运动估计
计算机视觉与模式识别
2026-03-05 v1 图形学
人机交互
摘要
以太人体运动估计是 AR/VR 体验的关键内容,但因 egocentric 视角导致覆盖范围有限、遮挡频繁且标注数据稀缺,仍面临挑战。我们提出 EgoPoseFormer v2 方法,通过两个关键创新来应对这些挑战:(1) 基于 transformer 的模型实现时序一致且空间定位准确的人体姿态估计,(2) 自动标注系统使大量未标注数据可用于训练。该模型全可微,引入身份条件查询、多视角空间细化、因果时序注意力机制,支持关键点和参数化人体表示,且在恒定计算预算下运行。自动标注系统通过不确定性感知的半监督训练扩展到数千万未标注帧。该系统遵循教师-学生架构生成伪标签并通过不确定性蒸馏指导训练,使模型能推广到不同环境。实验表明,在 EgoBody3M 数据集上,本模型在 GPU 上仅需 0.8 ms 延迟,准确率分别比两种最新方法提升 12.2% 和 19.4%,时序抖动降低 22.2% 和 51.7%。此外,自动标注系统进一步将手腕 MPJPE 提升 13.1%。
引用
@article{arxiv.2603.04090,
title = {EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VR},
author = {Zhenyu Li and Sai Kumar Dwivedi and Filip Maric and Carlos Chacon and Nadine Bertsch and Filippo Arcadu and Tomas Hodan and Michael Ramamonjisoa and Peter Wonka and Amy Zhao and Robin Kips and Cem Keskin and Anastasia Tkach and Chenhongyi Yang},
journal= {arXiv preprint arXiv:2603.04090},
year = {2026}
}
备注
Accepted to CVPR 2026