中文

通过无监督表示自适应追踪感兴趣的人

计算机视觉与模式识别 2017-10-06 v1

摘要

非受限视频中的多人脸追踪是一个具有挑战性的问题,因为同一个人的面部在多个镜头中往往由于尺度、姿态、表情、光照和妆容的显著变化而呈现出截然不同的外观。现有的多目标追踪方法通常使用低级特征,这些特征对于识别具有如此大外观变化的人脸缺乏足够的判别力。在本文中,我们通过使用卷积神经网络(CNN)学习具有判别性的、特定于视频的人脸表示来解决这个问题。与仅在离线大规模人脸图像数据集上训练的现有基于 CNN 的方法不同,我们利用上下文约束为给定视频生成大量训练样本,并使用发现的训练样本将预训练的人脸 CNN 适应到特定视频。使用这些训练样本,我们通过最小化三元组损失函数来优化嵌入空间,使得欧氏距离对应于语义人脸相似性的度量。利用学习到的判别性特征,我们应用层次聚类算法来关联多个镜头间的 tracklet 以生成轨迹。我们在两组电视情景剧和 YouTube 音乐视频上广泛评估了所提出的算法,分析了每个组件的贡献,并展示了相比现有技术的显著性能提升。

关键词

引用

@article{arxiv.1710.02139,
  title  = {Tracking Persons-of-Interest via Unsupervised Representation Adaptation},
  author = {Shun Zhang and Jia-Bin Huang and Jongwoo Lim and Yihong Gong and Jinjun Wang and Narendra Ahuja and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:1710.02139},
  year   = {2017}
}

备注

Project page: http://vllab1.ucmerced.edu/~szhang/FaceTracking/