Fish2Mesh Transformer:基于自我中心视觉的 3D 人体网格恢复
计算机视觉与模式识别
2025-03-11 v1 机器人学
摘要
自我中心人体估计允许从可穿戴相机的第一人称视角推断用户的身体姿态和形状。尽管已有研究使用姿态估计技术来克服头戴式鱼眼图像引起的自我遮挡和图像畸变,但 3D 人体网格恢复(HMR)技术中的类似进展仍然有限。我们引入了 Fish2Mesh,一种针对 3D 自我中心人体网格恢复设计的具备鱼眼感知的基于 Transformer 的模型。我们提出了一个自我中心位置嵌入块,为 Swin Transformer 生成特定的自我位置表,以减少鱼眼图像畸变。我们的模型利用多任务头进行 SMPL 参数回归和相机平移,并将 3D 和 2D 关节点估计作为辅助损失以支持模型训练。为了解决自我中心相机数据稀缺的问题,我们通过采用预训练的 4D-Human 模型和第三人称相机进行弱监督,创建了一个训练数据集。我们的实验表明,Fish2Mesh 优于先前最先进的 3D HMR 模型。
引用
@article{arxiv.2503.06089,
title = {Fish2Mesh Transformer: 3D Human Mesh Recovery from Egocentric Vision},
author = {David C. Jeong and Aditya Puranik and James Vong and Vrushabh Abhijit Deogirikar and Ryan Fell and Julianna Dietrich and Maria Kyrarini and Christopher Kitts},
journal= {arXiv preprint arXiv:2503.06089},
year = {2025}
}