中文

简单3D姿态特征支持人类和机器的社交场景理解

计算机视觉与模式识别 2026-02-23 v2 神经元与认知

摘要

人类轻松地从视觉输入中识别社交互动,但 underlying 的计算机制仍未知晓,社交互动识别挑战即便是最先进的深度神经网络(DNN)。我们假设人类依赖3D空间视觉姿态信息做出社交判断,而这种信息在大多数视觉DNN中缺乏。为测试这些假设,我们使用一种新颖的姿态与深度估计管道自动从短视频片段中提取3D身体关节位置。我们比较了这些身体关节预测人类社交判断的能力与来自350多款视觉DNN嵌入的能力。我们发现,身体关节的预测能力优于大多数DNN。随后,我们将3D身体关节简化为仅描述视频中人物3D位置和方向的更紧凑特征集。我们发现,这一最小3D特征集(但其2D对应物)是必要且足够解释完整身体关节集合的预测性能。这些最小3D特征还能预测DNN与人类社交判断的对齐程度,并显著提升其在此类任务上的性能。综上,这些发现表明,人类社交感知依赖于简单且显式的3D姿态信息。

关键词

引用

@article{arxiv.2511.03988,
  title  = {Simple 3D Pose Features Support Human and Machine Social Scene Understanding},
  author = {Wenshuo Qin and Leyla Isik},
  journal= {arXiv preprint arXiv:2511.03988},
  year   = {2026}
}

备注

28 pages, 6 figures