中文

MARLIN:用于人脸视频表示学习的掩码自编码器

计算机视觉与模式识别 2023-03-23 v3

摘要

本文提出一种自监督方法,从视频中学习通用人脸表示,可迁移至多种人脸分析任务,如人脸属性识别(FAR)、面部表情识别(FER)、DeepFake 检测(DFD)与唇形同步(LS)。我们提出的框架称为 MARLIN,是一种人脸视频掩码自编码器,从丰富的网络爬取无标注人脸视频中学习高度鲁棒且通用的人脸嵌入。作为一个具有挑战性的辅助任务,MARLIN 从稠密掩码的人脸区域(主要包括眼、鼻、口、唇与皮肤)重建人脸的时空细节,以捕获局部与全局特征,进而有助于编码通用且可迁移的特征。通过在多种下游任务上的大量实验,我们证明 MARLIN 是一种优秀的人脸视频编码器及特征提取器,在各类下游任务上表现稳定良好,包括 FAR(较有监督基准提升 1.13%)、FER(较无监督基准提升 2.64%)、DFD(较无监督基准提升 1.86%)、LS(Fréchet Inception 距离提升 29.36%),甚至在低数据情形下亦然。我们的代码与模型见于 https://github.com/ControlNet/MARLIN 。

关键词

引用

@article{arxiv.2211.06627,
  title  = {MARLIN: Masked Autoencoder for facial video Representation LearnINg},
  author = {Zhixi Cai and Shreya Ghosh and Kalin Stefanov and Abhinav Dhall and Jianfei Cai and Hamid Rezatofighi and Reza Haffari and Munawar Hayat},
  journal= {arXiv preprint arXiv:2211.06627},
  year   = {2023}
}

备注

CVPR 2023