InterMesh:显式交互感知的端到端多人人体网格恢复
计算机视觉与模式识别
2026-05-15 v2
摘要
人类不断与其周围环境进行交互。现有的端到端多人人体网格恢复方法通常基于 DETR 框架,通过所有人体查询间的自注意力来捕捉人与人之间的关系。然而,这些方法仅隐式地对交互进行建模,缺乏对人类如何与物体以及彼此之间进行交互的显式推理。在本文中,我们提出了 InterMesh,一个简单而有效的框架,它将人-环境交互信息显式地纳入人体网格恢复流程。通过利用人-物交互检测器,InterMesh 用结构化的交互语义丰富了查询表示,从而实现更准确的姿态和形状估计。我们设计了轻量级模块——上下文交互编码器和交互引导细化器,以将这些特征集成到现有的 HMR 架构中,且开销极小。我们通过在 3DPW、MuPoTS、CMU Panoptic、Hi4D 和 CHI3D 数据集上的大量实验验证了我们的方法,展示了对 SOTA 方法的显著改进。值得注意的是,InterMesh 在 CMU Panoptic 上将 MPJPE 降低了 9.9%,在 Hi4D 上降低了 8.2%,突出了其在复杂的人-物和人与人交互场景中的有效性。代码和模型已发布于 https://github.com/Kelly510/InterMesh。
引用
@article{arxiv.2605.04554,
title = {InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery},
author = {Kaili Zheng and Kaiwen Wang and Xun Zhu and Chenyi Guo and Ji Wu},
journal= {arXiv preprint arXiv:2605.04554},
year = {2026}
}
备注
13 pages, 10 figures