中文

用于视频人脸聚类的自监督以视频为中心的 Transformer

计算机视觉与模式识别 2023-02-16 v4

摘要

本文提出一种利用以视频为中心的 Transformer 进行视频中人脸聚类的新方法。以往工作常采用对比学习来学习帧级表示,并使用平均池化沿时间维度聚合特征,该方法可能无法充分捕捉复杂的视频动态。此外,尽管基于视频的对比学习近期取得进展,鲜有尝试学习有益于视频人脸聚类任务的自监督、聚类友好的人脸表示。为克服这些局限,我们的方法采用 Transformer 直接学习能更好反映视频中人脸时变特性的视频级表示,同时提出以视频为中心的自监督框架来训练该 Transformer 模型。我们还研究了第一人称视频中的人脸聚类——这一在人脸聚类相关工作中尚未被探索的快速新兴领域。为此,我们提出并发布了首个大规模第一人称视频人脸聚类数据集 EasyCom-Clustering。我们在广泛使用的 Big Bang Theory (BBT) 数据集与新的 EasyCom-Clustering 数据集上评估所提方法。结果表明,我们的以视频为中心的 Transformer 在两项基准上均超越所有先前 SOTA 方法,展现出对人脸视频的自注意力理解。

关键词

引用

@article{arxiv.2203.13166,
  title  = {Self-supervised Video-centralised Transformer for Video Face Clustering},
  author = {Yujiang Wang and Mingzhi Dong and Jie Shen and Yiming Luo and Yiming Lin and Pingchuan Ma and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2203.13166},
  year   = {2023}
}

备注

Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)