Multi-HMR:单张图像中的多人全身人体网格恢复
计算机视觉与模式识别
2024-07-25 v2
摘要
我们提出了 Multi-HMR,一个用于从单张 RGB 图像中恢复多人 3D 人体网格的强大单次预测(single-shot)模型。该模型使用 SMPL-X 参数化模型和相机坐标系下的 3D 位置,其预测涵盖全身,即包括手部和面部表情。我们的模型通过预测人物位置的粗糙 2D 热力图来检测人物,使用标准 Vision Transformer (ViT) 主干网络生成的特征。随后,它使用一个名为 Human Prediction Head (HPH) 的新型交叉注意力模块预测人物的全身姿态、形状和 3D 位置,每个检测到的人物使用一个查询来关注整个特征集合。由于在单次预测中直接预测细粒度的手部和面部姿态(即不依赖对身体部位的显式裁剪)很难从现有数据中学习,我们引入了 CUFFS(Close-Up Frames of Full-Body Subjects)数据集,其中包含靠近相机且具有多样手部姿态的人类图像。我们表明,将其纳入训练数据可进一步增强预测效果,特别是对于手部。Multi-HMR 还可选择性地在可用时考虑相机内参,通过为每个图像 token 编码相机射线方向来实现。这种简单的设计同时在全身和仅身体基准测试上取得了强劲的性能:在 图像上使用 ViT-S 主干网络已经能够产生快速且具竞争力的模型,而更大的模型和更高的分辨率则获得了 SOTA 结果。
引用
@article{arxiv.2402.14654,
title = {Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot},
author = {Fabien Baradel and Matthieu Armando and Salma Galaaoui and Romain Brégier and Philippe Weinzaepfel and Grégory Rogez and Thomas Lucas},
journal= {arXiv preprint arXiv:2402.14654},
year = {2024}
}
备注
Accepted at ECCV'24 - Code: https://github.com/naver/multi-hmr