Coordinate Transformer:从视频中实现单阶段多人网格恢复
计算机视觉与模式识别
2023-08-22 v1
摘要
从视频中进行多人 3D 网格恢复是虚拟现实、物理治疗等领域中群体行为自动感知的关键第一步。然而,现有方法依赖多阶段范式,其中人物检测与追踪阶段在多人场景下完成,而时间动态仅针对单人逐一建模。因此,其性能严重受限于空间-时间网格恢复中缺乏人际交互,以及检测与追踪缺陷。为应对这些挑战,我们提出 Coordinate transFormer(CoordFormer),它直接建模多人空间-时间关系并以端到端方式同时执行多网格恢复。CoordFormer 未将特征图划分为粗尺度块级 token,而是利用一种新颖的坐标感知注意力(Coordinate-Aware Attention)来保留像素级空间-时间坐标信息。此外,我们提出一种简单而有效的身体中心注意力(Body Center Attention)机制来融合位置信息。在 3DPW 数据集上的大量实验表明,CoordFormer 显著提升了当前最优水平,根据 MPJPE、PAMPJPE 和 PVE 指标分别比先前最佳结果高出 4.2%、8.8% 和 4.7%,同时比近期基于视频的方法快 40%。发布的代码可在 https://github.com/Li-Hao-yuan/CoordFormer 找到。
引用
@article{arxiv.2308.10334,
title = {Coordinate Transformer: Achieving Single-stage Multi-person Mesh Recovery from Videos},
author = {Haoyuan Li and Haoye Dong and Hanchao Jia and Dong Huang and Michael C. Kampffmeyer and Liang Lin and Xiaodan Liang},
journal= {arXiv preprint arXiv:2308.10334},
year = {2023}
}
备注
ICCV 2023