中文

面向小数据集的多域多定义关键点定位

计算机视觉与模式识别 2022-10-17 v3

摘要

我们提出了一种用于小数据集面部定位的多图像域和多关键点定义学习的新方法。将小数据集与一个(或多个)更大的数据集一起训练,有助于前者进行鲁棒学习,并为新的和/或更小的标准数据集提供一种通用的面部关键点定位机制。为此,我们提出了一个Vision Transformer编码器,并配有一个新颖的解码器,该解码器具有一个与定义无关的共享关键点语义组结构先验,该先验是在我们同时训练多个数据集时学习到的。由于我们新颖的与定义无关的组先验,这些数据集在关键点定义和图像域上可能有所不同。在解码器阶段,我们使用交叉注意力和自注意力,其输出随后被送入特定于域/定义的头,这些头最小化拉普拉斯对数似然损失。当与更大的数据集一起训练时,我们在标准关键点定位数据集(如COFW和WFLW)上取得了最先进的性能。我们还在动物、漫画和面部肖像画等多个不同图像域的小数据集上展示了最先进的性能。此外,我们贡献了一个包含150张幻想性错觉图像的小数据集,以展示我们方法的有效性。最后,我们提供了若干分析和消融研究来证明我们的主张。

关键词

引用

@article{arxiv.2203.10358,
  title  = {Multi-Domain Multi-Definition Landmark Localization for Small Datasets},
  author = {David Ferman and Gaurav Bharaj},
  journal= {arXiv preprint arXiv:2203.10358},
  year   = {2022}
}

备注

European Conference on Computer Vision, 2022