AniMer:基于族感知变换器的动物姿态与形状估计
计算机视觉与模式识别
2025-07-08 v2
摘要
对动物行为和力学进行量化分析需要跨物种准确的动物姿态与形状估计,这对于动物福利和生物学研究至关重要。然而,现有方法的网络容量较小且多物种数据集有限,导致该问题未得到充分探索。为此,本文提出AniMer,通过族感知变换器(family aware Transformer)来估计动物姿态与形状,提升多样化四足动物家族的重建精度。AniMer的关键思想在于将高容量变换器主干网络与动物族 Supervised 对比学习方案相结合,在单一框架中统一对各种四足动物形状的判别性理解。为有效训练,我们聚合了大多数可获取的四足动物数据集,包含3D或2D标签。为提升3D标注数据的多样性,我们引入CtrlAni3D,一个通过新型扩散条件图像生成管道创建的大型合成数据集。CtrlAni3D包含约1万张具有像素对齐SMAL标签的图像。总体而言,我们获得4.13万张标注图像用于训练和验证。因此,族感知变换器网络与大型数据集的结合,使AniMer在Animal3D和CtrlAni3D等3D数据集上,以及野外的Animal Kingdom数据集等分布外数据集上均超越现有方法。消融研究进一步证明了我们网络设计和CtrlAni3D在提升AniMer野外应用性能方面的有效性。AniMer项目页面为https://luoxue-star.github.io/AniMer_project_page/。
引用
@article{arxiv.2412.00837,
title = {AniMer: Animal Pose and Shape Estimation Using Family Aware Transformer},
author = {Jin Lyu and Tianyi Zhu and Yi Gu and Li Lin and Pujin Cheng and Yebin Liu and Xiaoying Tang and Liang An},
journal= {arXiv preprint arXiv:2412.00837},
year = {2025}
}
备注
Accepted by CVPR25