中文

SCE-MAE:基于掩码自编码器的选择性对应性增强用于自监督人工智能 landmark 估计

计算机视觉与模式识别 2024-05-29 v1 人工智能

摘要

自监督人工智能 landmark 估计是一个具有挑战性的任务,需要在缺乏注释数据的情况下形成局部独特的特征表示来识别稀疏的人脸 landmark。为解决这一问题,现有的SOTA方法(1)从采用实例级自监督学习(SSL)范式训练的 backbone 中提取粗糙特征,忽略该任务的稠密预测本质,(2)将其聚合成计算密集的超列(highcolumn)形式,(3)对轻量级投影网络进行监督,盲目地在所有空间特征对之间建立完整的局部对应关系。在本文中,我们引入SCE-MAE框架(1)利用MAE,这是一种更适合人工智能预测任务的区域级SSL方法,(2)在原始特征图上工作,而非在高成本的超列上,(3)采用对应近似与细化模块(CARB),该模块利用简单的密度峰值聚类算法和我们提出的局部约束排斥损失(Locality-Constrained Repellence Loss),直接精炼仅选定的局部对应关系。我们通过大量实验表明,SCE-MAE在人工智能匹配和人工智能检测任务上分别优于现有SOTA方法,分别提高了约20%-44%和9%-15%。

关键词

引用

@article{arxiv.2405.18322,
  title  = {SCE-MAE: Selective Correspondence Enhancement with Masked Autoencoder for Self-Supervised Landmark Estimation},
  author = {Kejia Yin and Varshanth R. Rao and Ruowei Jiang and Xudong Liu and Parham Aarabi and David B. Lindell},
  journal= {arXiv preprint arXiv:2405.18322},
  year   = {2024}
}

备注

Accepted at CVPR 2024