中文

CLAMP:基于提示的对比学习连接语言与动物姿态

计算机视觉与模式识别 2023-08-29 v3

摘要

由于训练数据有限以及种内与种间差异大,动物姿态估计对现有基于图像的方法而言具有挑战性。受视觉-语言研究进展的启发,我们提出预训练语言模型(如CLIP)可通过提供描述动物关键点的丰富先验知识来辅助动物姿态估计。然而,我们发现构建预训练语言模型与视觉动物关键点之间的有效连接并非易事,因为基于文本的描述与基于关键点的动物姿态视觉特征之间的差距可能很大。为解决此问题,我们引入了一种新颖的基于提示的对比学习方案,以有效连接语言与动物姿态(CLAMP)。CLAMP试图在网络训练过程中使文本提示适应动物关键点,从而弥合差距。该适应被分解为空间感知与特征感知两个过程,并相应设计了两种新颖的对比损失。实践中,CLAMP实现了首个跨模态动物姿态估计范式。实验结果表明,我们的方法在有监督、少样本和零样本设定下均达到最先进性能,大幅优于基于图像的方法。

关键词

引用

@article{arxiv.2206.11752,
  title  = {CLAMP: Prompt-based Contrastive Learning for Connecting Language and Animal Pose},
  author = {Xu Zhang and Wen Wang and Zhe Chen and Yufei Xu and Jing Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2206.11752},
  year   = {2023}
}

备注

CVPR2023