中文

面向基于视频的人脸识别中无监督域适应的双三元组度量学习

计算机视觉与模式识别 2020-02-12 v1 图像与视频处理

摘要

深度学习模型的可扩展性和复杂性在许多视觉识别应用中仍是一个关键问题,例如视频监控,其中需要使用来自每个新摄像机的标注图像数据进行微调,以减少从源域(如实验室环境)捕获的视频与目标域(即运行环境)之间的域偏移。在许多视频监控应用(如人脸识别(FR)和行人重识别)中,使用成对匹配器将视频摄像机捕获的查询图像分配给库中的相应参考图像。视频摄像机的不同配置和运行条件会引入成对距离分布的显著偏移,导致新摄像机的识别性能下降。本文提出一种新的深度域适应(DA)方法,利用新视频摄像机捕获的无标签轨迹片段(tracklets)来适应Siamese网络的CNN嵌入。为此,引入双三元组损失用于度量学习,其中使用来自源摄像机和新的目标摄像机的视频数据构造两个三元组。为了构成双三元组,引入了一种互监督学习方法,其中源摄像机充当教师,为目标摄像机提供初始嵌入。然后,学生依靠教师迭代地标注在初始摄像机标定期间收集的正样本对和负样本对。源和目标嵌入持续同时学习,使它们的成对距离分布对齐。为验证,所提度量学习技术在不同训练场景下用于训练深度Siamese网络,并在COX-S2V和一个私有的基于视频的人脸识别数据集上与最先进(SOTA)的静态到视频FR技术进行比较。

关键词

引用

@article{arxiv.2002.04206,
  title  = {Dual-Triplet Metric Learning for Unsupervised Domain Adaptation in Video-Based Face Recognition},
  author = {George Ekladious and Hugo Lemoine and Eric Granger and Kaveh Kamali and Salim Moudache},
  journal= {arXiv preprint arXiv:2002.04206},
  year   = {2020}
}

备注

Submitted too IJCNN2020