中文

基于 Transformer 的多人体网格恢复

计算机视觉与模式识别 2024-02-27 v1

摘要

传统的人体网格恢复方法主要采用基于区域的策略。这涉及首先裁剪出以人为中心的区域作为预处理步骤,随后的建模专注于这一放大的图像。虽然这种方法对单个人物有效,但在处理包含多人的图像时面临挑战,因为不同的人是分开处理的,往往导致相对位置不准确。尽管采用基于整张图像的方法可以解决这一局限性,但早期的尝试在性能上仍不及最近的基于区域的方法。在本工作中,我们提倡这一尚未充分探索的领域,即同时对所有人进行建模,强调通过同时考虑所有个体并利用整体上下文和交互,在多人员场景中提高准确性的潜力。我们引入了一种具有简化 Transformer 架构的新模型,其特点包括三个关键设计选择:多尺度特征融合、聚焦注意力机制和相对关节监督。我们提出的模型展示了显著的性能提升,在涉及多人的各种基准测试中超越了最先进的基于区域和基于整图的方法。

关键词

引用

@article{arxiv.2402.16806,
  title  = {Multi-Human Mesh Recovery with Transformers},
  author = {Zeyu Wang and Zhenzhen Weng and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2402.16806},
  year   = {2024}
}