中文

面向动物姿态估计的概率提示分布学习

计算机视觉与模式识别 2025-03-21 v1

摘要

多物种动物姿态估计已成为一项极具挑战性且关键的任务,受到显著的视觉多样性和不确定性的阻碍。本文通过对视觉-语言预训练(VLP)模型(例如 CLIP)进行高效的提示学习来应对这一问题,旨在解决跨物种泛化问题。该解决方案的核心在于提示设计、概率提示建模和跨模态适应,从而使提示能够补偿跨模态信息,并有效克服数据分布不均衡下的巨大数据方差。为此,我们提出了一种新颖的概率提示方法以充分探索文本描述,这可以缓解由长尾特性引起的多样性问题,并提高提示在未见类别实例上的适应性。具体而言,我们首先引入一组可学习的提示,并提出多样性损失以保持提示间的差异性,从而表示多样的图像属性。我们采样多样的文本概率表示,并将其作为姿态估计的指导。随后,我们在空间层面探索了三种不同的跨模态融合策略,以缓解视觉不确定性的不利影响。在多物种动物姿态基准上的大量实验表明,我们的方法在监督和零样本设置下均取得了 SOTA 性能。代码可在 https://github.com/Raojiyong/PPAP 获取。

关键词

引用

@article{arxiv.2503.16120,
  title  = {Probabilistic Prompt Distribution Learning for Animal Pose Estimation},
  author = {Jiyong Rao and Brian Nlong Zhao and Yu Wang},
  journal= {arXiv preprint arXiv:2503.16120},
  year   = {2025}
}

备注

Accepted by CVPR 2025