中文

LAMP:利用语言提示进行多人姿态估计

计算机视觉与模式识别 2023-07-28 v2

摘要

以人为中心的视觉理解对于有效的人机交互十分重要。为了穿越拥挤的公共场所,社交机器人必须能够解读周围人类的活动。本文探讨以人为中心的视觉理解的一个关键方面,即多人姿态估计。由于在遮挡关节与实例分离方面的挑战,在拥挤场景中取得良好的多人姿态估计性能十分困难。为应对这些挑战并克服图像特征在表征不可见身体部位上的局限,我们提出一种称为 LAMP(语言辅助多人姿态估计,Language Assisted Multi-person Pose estimation)的基于提示的姿态推断新策略。通过利用训练良好的语言模型(CLIP)生成的文本表征,LAMP 可促进在实例与关节层面对姿态的理解,并学习对遮挡较不敏感的更鲁棒视觉表征。本文证明语言监督训练提升了单阶段多人姿态估计的性能,且实例级与关节级提示对训练均有价值。代码见 https://github.com/shengnanh20/LAMP。

关键词

引用

@article{arxiv.2307.11934,
  title  = {LAMP: Leveraging Language Prompts for Multi-person Pose Estimation},
  author = {Shengnan Hu and Ce Zheng and Zixiang Zhou and Chen Chen and Gita Sukthankar},
  journal= {arXiv preprint arXiv:2307.11934},
  year   = {2023}
}