VideoClusterNet: 自监督和自适应的视频人脸聚类
计算机视觉与模式识别
2024-09-19 v2
摘要
随着数字媒体内容生产的兴起,分析电影和电视系列剧集以精确定位主要角色人物的需求日益重要。具体而言,视频人脸聚类旨在将检测到的视频人脸轨迹按共同的面部身份进行分组。由于给定人脸在视频帧中存在大范围的姿态、表情、外观和光照变化,该问题极具挑战性。通用的预训练人脸识别(ID)模型难以适应视频制作领域,由于该领域具有高动态范围内容和独特的电影风格。此外,传统聚类算法依赖于需要在不同数据集上单独调优的超参数。本文提出一种新颖的视频人脸聚类方法,该方法以完全自监督的方式学习适应新视频人脸轨迹的通用人脸 ID 模型。我们还提出一种无参数聚类算法,能够自动适应针对任何输入视频调整后的模型嵌入空间。由于缺乏全面的电影人脸聚类基准,本文还提供一种首创性的电影数据集:MovieFaceCluster。该数据集由影视行业专业人士精选,包含极具挑战性的人脸识别场景。实验表明,我们的方法在本基准数据集上有效处理了困难的主流电影场景,在传统电视系列数据集上实现了最先进的性能。
引用
@article{arxiv.2407.12214,
title = {VideoClusterNet: Self-Supervised and Adaptive Face Clustering For Videos},
author = {Devesh Walawalkar and Pablo Garrido},
journal= {arXiv preprint arXiv:2407.12214},
year = {2024}
}
备注
Accepted at European Conference on Computer Vision (ECCV) 2024