简单3D姿态特征支持人类和机器的社交场景理解
计算机视觉与模式识别
2026-02-23 v2 神经元与认知
摘要
人类轻松地从视觉输入中识别社交互动,但 underlying 的计算机制仍未知晓,社交互动识别挑战即便是最先进的深度神经网络(DNN)。我们假设人类依赖3D空间视觉姿态信息做出社交判断,而这种信息在大多数视觉DNN中缺乏。为测试这些假设,我们使用一种新颖的姿态与深度估计管道自动从短视频片段中提取3D身体关节位置。我们比较了这些身体关节预测人类社交判断的能力与来自350多款视觉DNN嵌入的能力。我们发现,身体关节的预测能力优于大多数DNN。随后,我们将3D身体关节简化为仅描述视频中人物3D位置和方向的更紧凑特征集。我们发现,这一最小3D特征集(但其2D对应物)是必要且足够解释完整身体关节集合的预测性能。这些最小3D特征还能预测DNN与人类社交判断的对齐程度,并显著提升其在此类任务上的性能。综上,这些发现表明,人类社交感知依赖于简单且显式的3D姿态信息。
引用
@article{arxiv.2511.03988,
title = {Simple 3D Pose Features Support Human and Machine Social Scene Understanding},
author = {Wenshuo Qin and Leyla Isik},
journal= {arXiv preprint arXiv:2511.03988},
year = {2026}
}
备注
28 pages, 6 figures