中文

基于预训练扩散模型的无监督关键点提取

计算机视觉与模式识别 2024-05-24 v3

摘要

在无监督关键点与地标学习方面,现代神经网络架构带来了显著进展,但其性能尚不及有监督方法,使其实用性存疑。我们利用文本到图像扩散模型中涌现的知识,以实现更鲁棒的无监督关键点。我们的核心思想是寻找文本嵌入,使得生成模型始终关注图像中的紧凑区域(即关键点)。为此,我们简单地优化文本嵌入,使去噪网络内的交叉注意力图局部化为具有小标准差的高斯分布。我们在多个数据集上验证性能:CelebA、CUB-200-2011、Tai-Chi-HD、DeepFashion 和 Human3.6m 数据集。我们取得了显著改善的精度,有时甚至超越有监督方法,尤其对于未对齐且较少筛选的数据。我们的代码已公开,可通过项目主页获取:https://ubc-vision.github.io/StableKeypoints/

关键词

引用

@article{arxiv.2312.00065,
  title  = {Unsupervised Keypoints from Pretrained Diffusion Models},
  author = {Eric Hedlin and Gopal Sharma and Shweta Mahajan and Xingzhe He and Hossam Isack and Abhishek Kar Helge Rhodin and Andrea Tagliasacchi and Kwang Moo Yi},
  journal= {arXiv preprint arXiv:2312.00065},
  year   = {2024}
}