LAMP:利用语言提示进行多人姿态估计
计算机视觉与模式识别
2023-07-28 v2
摘要
以人为中心的视觉理解对于有效的人机交互十分重要。为了穿越拥挤的公共场所,社交机器人必须能够解读周围人类的活动。本文探讨以人为中心的视觉理解的一个关键方面,即多人姿态估计。由于在遮挡关节与实例分离方面的挑战,在拥挤场景中取得良好的多人姿态估计性能十分困难。为应对这些挑战并克服图像特征在表征不可见身体部位上的局限,我们提出一种称为 LAMP(语言辅助多人姿态估计,Language Assisted Multi-person Pose estimation)的基于提示的姿态推断新策略。通过利用训练良好的语言模型(CLIP)生成的文本表征,LAMP 可促进在实例与关节层面对姿态的理解,并学习对遮挡较不敏感的更鲁棒视觉表征。本文证明语言监督训练提升了单阶段多人姿态估计的性能,且实例级与关节级提示对训练均有价值。代码见 https://github.com/shengnanh20/LAMP。
引用
@article{arxiv.2307.11934,
title = {LAMP: Leveraging Language Prompts for Multi-person Pose Estimation},
author = {Shengnan Hu and Ce Zheng and Zixiang Zhou and Chen Chen and Gita Sukthankar},
journal= {arXiv preprint arXiv:2307.11934},
year = {2023}
}