AP-CAP:基于可控图像生成管道的动物姿态估计高质量数据合成
计算机视觉与模式识别
2025-04-02 v1
摘要
2D 动物姿态估计在推动动物行为分析和生态研究中的深度学习应用方面发挥着关键作用。尽管已有一些方法取得了显著进展,但我们发现高质量数据集的稀缺仍是当前方法潜力的主要瓶颈。为此,我们提出一种新型可控图像生成管道,用于合成动物姿态估计数据,称之为 AP-CAP。在该管道中,我们引入一种多模态动物图像生成模型,能够生成预期的姿态。为提升生成数据的质量和多样性,我们进一步提出了三项创新策略:(1)基于模态融合的动物图像合成策略,以整合多源外观表征;(2)基于姿态调整的动物图像合成策略,以动态捕获多样化的姿态变化;(3)基于标题增强的动物图像合成策略,以丰富视觉语义理解。利用所提出的模型和策略,我们创建了 MPCH 数据集(Modality-Pose-Caption Hybrid),这是目前为动物姿态估计建立的最大规模多源异构基准数据集,首次创新性地将合成数据和真实数据组合在一起。广泛的实验表明,我们的方法在提升动物姿态估计器的性能和泛化能力方面具有优势。
引用
@article{arxiv.2504.00394,
title = {AP-CAP: Advancing High-Quality Data Synthesis for Animal Pose Estimation via a Controllable Image Generation Pipeline},
author = {Lei Wang and Yujie Zhong and Xiaopeng Sun and Jingchun Cheng and Chengjian Feng and Qiong Cao and Lin Ma and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2504.00394},
year = {2025}
}