基于姿态引导自训练与两阶段聚类的无监督关键点发现
计算机视觉与模式识别
2024-03-26 v1
摘要
针对物体类别的无监督关键点发现(ULD)是一个具有挑战性的计算机视觉问题。为了开发稳健的ULD框架,我们探索了近期一种称为扩散模型(diffusion models)的自监督学习算法范式的潜力。近期的一些工作表明,这些模型隐式地包含重要的对应线索。为了发挥扩散模型在ULD任务中的潜力,我们做出以下核心贡献。首先,我们提出了一种基于随机像素位置简单聚类与最近邻匹配的零样本(ZeroShot)ULD基线。它比现有的ULD方法 delivers 更好的结果。其次,受零样本性能的启发,我们开发了一种基于扩散特征的ULD算法,采用自训练和聚类,同样以显著优势优于先前的方法。第三,我们引入了一个基于生成潜在姿态码的新代理任务,并提出了一种两阶段聚类机制以促进有效的伪标签生成,从而带来显著的性能提升。总体而言,我们的方法在四个具有挑战性的基准数据集 AFLW、MAFL、CatHeads 和 LS3D 上持续以显著优势优于 SOTA 方法。
引用
@article{arxiv.2403.16194,
title = {Pose-Guided Self-Training with Two-Stage Clustering for Unsupervised Landmark Discovery},
author = {Siddharth Tourani and Ahmed Alwheibi and Arif Mahmood and Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2403.16194},
year = {2024}
}
备注
Accepted in CVPR 2024