DeforHMR:用于三维人体网格恢复的具有可变形交叉注意力的视觉 Transformer
计算机视觉与模式识别
2024-11-19 v1
摘要
人体网格恢复(HMR)是一个重要但具有挑战性的问题,其应用遍及运动捕捉、增强现实和生物力学等多个领域。从单张图像中准确预测人体姿态参数仍然是一项具有挑战性的三维计算机视觉任务。在这项工作中,我们引入了 DeforHMR,这是一个新颖的基于回归的单目 HMR 框架,旨在利用可变形注意力 Transformer 增强对人体姿态参数的预测。DeforHMR 在 Transformer 解码器内部利用了一种新颖的查询无关的可变形交叉注意力机制,以有效地回归从冻结的预训练视觉 Transformer(ViT)编码器中提取的视觉特征。所提出的可变形交叉注意力机制允许模型以更灵活且数据依赖的方式关注相关的空间特征。凭借能够进行空间细微注意力的 Transformer 解码器,DeforHMR 在广泛使用的三维 HMR 基准数据集 3DPW 和 RICH 上,针对基于单帧的回归方法实现了最先进的性能。通过可变形注意力推动三维人体网格恢复领域的边界,我们为计算机视觉中解码来自大型预训练视觉编码器的局部空间信息引入了一种新的、有效的范式。
引用
@article{arxiv.2411.11214,
title = {DeforHMR: Vision Transformer with Deformable Cross-Attention for 3D Human Mesh Recovery},
author = {Jaewoo Heo and George Hu and Zeyu Wang and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2411.11214},
year = {2024}
}
备注
11 pages, 5 figures, 3DV2025