SocialGesture:多人姿态理解探讨
计算机视觉与模式识别
2025-04-04 v1
摘要
以往的人体姿态识别研究在多人交互方面 largely 忽视了这些问题,这对于理解自然发生的姿态在社交语境中的作用至关重要。这一现有数据集的局限性在将人类姿态与其他模态(如语言和语音)对齐方面 presents 一个重大的挑战。为此,我们引入 SocialGesture,这是第一个专为多人姿态分析设计的大型数据集。SocialGesture 包含多样化的自然场景,支持包括基于视频的识别和时间局部化在内的多项姿态分析任务,为推动社交互动中姿态研究提供了宝贵资源。此外,我们提出了一种新的视觉问答 (VQA) 任务,用于基准测试视觉语言模型 (VLMs) 在社交姿态理解方面的性能。我们的发现突显了当前姿态识别模型的多个局限性,为该领域的改进提供了洞见。SocialGesture 可在 huggingface.co/datasets/IrohXu/SocialGesture 访问。
引用
@article{arxiv.2504.02244,
title = {SocialGesture: Delving into Multi-person Gesture Understanding},
author = {Xu Cao and Pranav Virupaksha and Wenqi Jia and Bolin Lai and Fiona Ryan and Sangmin Lee and James M. Rehg},
journal= {arXiv preprint arXiv:2504.02244},
year = {2025}
}
备注
CVPR 2025