DiffPose-Animal:一种面向动物姿态估计的语言条件扩散框架
计算机视觉与模式识别
2025-12-16 v2
摘要
动物姿态估计是计算机视觉中的一项基本任务,在生态监测、行为分析和智能畜牧管理中日益重要。与人体姿态估计相比,动物姿态估计更具挑战性,因为其存在高度的种间形态多样性、复杂的身体结构以及有限的标注数据。在这项工作中,我们引入了DiffPose-Animal,这是一种新颖的基于扩散的自顶向下动物姿态估计框架。与传统的热图回归方法不同,DiffPose-Animal将姿态估计重新表述为扩散模型生成框架下的去噪过程。为了增强关键点生成过程中的语义引导,我们利用大语言模型(LLMs)基于物种特定的提示,提取全局解剖先验和局部关键点语义。这些文本先验被编码并通过交叉注意力模块与图像特征融合,以在整个去噪过程中提供具有生物学意义的约束。此外,还设计了一个基于扩散的关键点解码器,以逐步细化姿态预测,提高对遮挡和标注稀疏性的鲁棒性。在公开的动物姿态数据集上进行的大量实验证明了我们方法的有效性和泛化能力,尤其是在物种多样、背景杂乱和关键点不完整的挑战性场景下。
引用
@article{arxiv.2508.08783,
title = {DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation},
author = {Tianyu Xiong and Dayi Tan and Wei Tian},
journal= {arXiv preprint arXiv:2508.08783},
year = {2025}
}
备注
13pages,2figures