中文

BigMaQ:连接图像与3D姿态表示的大猕猴动作与动画数据集

计算机视觉与模式识别 2026-02-24 v1

摘要

动物行为的识别与社交行为分析是推动生态学、生态学、医学和神经科学进步的关键。近期的深度学习进展使动物行为从视频中自动识别成为可能,但尚未将三维(3D)姿态和形状的准确重建集成到这一过程中。尤其是对于非人类灵长类动物,基于网格的跟踪工作在其他物种之后继乃至不及,使得姿态描述受限于稀疏关键点,无法完全捕捉动作动态的丰富性。为填补这一空白,我们引入BigMaQ,一个大型数据集,包含超过750个灵长类猴子相互作用场景,具有详细的3D姿态描述。扩展前面的基于表面的动物跟踪方法,我们通过适应高质量猴子模板网格来构建每个猴子的主题化纹理化模型。这使得我们能够提供比以前的基于表面的动物跟踪方法更准确的姿态描述。从原始数据集中,我们派生出BigMaQ500,一个将基于表面的姿态向量与单个帧在多个单个猴子之间关联的动作识别基准。通过将从 established image 和 video 编码器中提取的特征与和不使用我们姿态描述符的特征组合起来,我们演示了在包含姿态信息时,平均精度(mAP)实现了显著的提高。通过这些贡献,BigMaQ建立了第一个将动态3D姿态-形状表示集成到动物动作识别学习任务中,并提供了一个丰富的资源,以推动非人类灵长类的视觉外观、姿态和社交互动研究。代码和数据可在https://martinivis.github.io/BigMaQ/获取。

关键词

引用

@article{arxiv.2602.19874,
  title  = {BigMaQ: A Big Macaque Motion and Animation Dataset Bridging Image and 3D Pose Representations},
  author = {Lucas Martini and Alexander Lappe and Anna Bognár and Rufin Vogels and Martin A. Giese},
  journal= {arXiv preprint arXiv:2602.19874},
  year   = {2026}
}