APTv2:基于大规模数据集的动物姿态估计与跟踪基准及更多
计算机视觉与模式识别
2023-12-27 v1
摘要
动物姿态估计与跟踪(APT)是检测和监测一系列视频帧中动物关键点的关键任务,对于理解动物行为至关重要。以往与动物相关的工作主要集中于动物跟踪或单帧动物姿态估计,忽略了这两个方面的整合。缺乏全面的APT数据集阻碍了基于视频的动物姿态估计与跟踪方法的发展和评估,从而限制了它们的实际应用。为了填补这一空白,我们引入了APTv2,这是首个用于动物姿态估计与跟踪的大规模基准。APTv2包含从30个不同动物物种中筛选和收集的2,749个视频片段。每个视频片段包含15帧,总计41,235帧。经过细致的人工标注和严格的验证,我们为总共84,611个动物实例提供了高质量的关键点和跟踪标注,并根据帧中存在的实例数量分为简单和困难子集。以APTv2为基础,我们建立了一个名为\posetrackmethodname的简单基线方法,并为三个赛道提供了代表性模型的基准:(1)单帧动物姿态估计赛道,用于评估域内和跨域迁移学习性能;(2)低数据迁移与泛化赛道,用于评估跨物种域泛化性能;(3)动物姿态跟踪赛道。我们的实验结果提供了关键的实证见解,表明APTv2是动物姿态估计与跟踪的有价值基准,同时也为未来研究带来了新的挑战和机遇。代码和数据集发布于\href{https://github.com/ViTAE-Transformer/APTv2}{https://github.com/ViTAE-Transformer/APTv2}。
引用
@article{arxiv.2312.15612,
title = {APTv2: Benchmarking Animal Pose Estimation and Tracking with a Large-scale Dataset and Beyond},
author = {Yuxiang Yang and Yingqi Deng and Yufei Xu and Jing Zhang},
journal= {arXiv preprint arXiv:2312.15612},
year = {2023}
}